Reddit热议!4B小模型叫板Qwen 9B,还支持1M上下文?
2026-09-02 19:42:01
28次阅读
2个评论
Reddit用户发现全新架构的Spark-X2.5系列小模型(4B/1.7B),基准测试声称4B版本与Qwen 3.5 9B势均力敌,且支持原生1M上下文。网友惊叹训练数据量达20T,但质疑其实际表现,有测试者称其在“洗车”测试中出错,且目前需自定义llama.cpp分支才能运行。
0
0
2026-09-02 19:42:33

回复 |
引用
2026-09-02 19:43:03

回复 |
引用
共2条
1
相关帖子
- Reddit热议!老外如何评价DeepSeek V4 Flash本地跑满1M上下文?
- Reddit热议!Qwen3.7开放权重版首曝,1M上下文窗口引期待
- Reddit热议!大神自制补丁让DeepSeek V4 Flash在RTX 5090上跑满1M上下文
- Reddit热议!MiniMax M3模型发布,百万上下文+多模态引期待
- 本地运行Qwen 3.6 MTP模型:300K上下文实测与性能飞跃
- Reddit热议!4B小模型编程智能体逆袭,框架设计比模型大小更重要
- Reddit热帖!16GB显卡硬刚27B大模型,100K上下文跑满速
- 12GB显存跑Qwen3.6 35B:80tok/s+128K上下文!llama.cpp MTP攻略
- Claude上下文token占用离谱引AI使用认知热议
- Reddit热帖!开发者成功将DeepSeek V4量化KV缓存修复合并,单卡RTX PRO 6000跑百万上下文