Reddit爆火!老外怎么看0.8B小模型移植51B记忆?
2026-09-26 08:17:45
10次阅读
3个评论
网友实验将Qwen3.8的n-gram记忆移植到0.8B模型,困惑度降5%,引发热议。有人质疑只是适配器训练效果,有人调侃“小脑袋大记忆”,还有人已在4B/35B上复现并讨论PLE迁移是否可行。
0
0
2026-09-26 08:18:17

回复 |
引用
2026-09-26 08:18:46

回复 |
引用
2026-09-26 08:19:15

回复 |
引用
共3条
1
相关帖子
- Reddit热议!老外怎么看7B小模型跑分碾压大模型?
- Reddit热议!Qwen3.8-Flash-Next明日发布,125B参数+51B N-gram引期待
- Reddit爆火!老外怎么看4B模型零代币通关我的世界?
- Reddit热议!老外怎么看AI小模型发布荒?
- Reddit爆火!老外怎么看Opus 5.5被称为史上最佳模型?
- Reddit爆火!老外怎么看Qwen 3.8 27B的“话痨式”推理?
- Reddit热议!老外怎么看Engram技术让本地小模型逆袭?
- Reddit热议!2B小模型性能堪比120B大模型?
- Reddit热议!老外怎么看全脸移植手术?
- Reddit爆火!老外怎么看英伟达开放模型公开信背后的真相?