Reddit热议!本地大模型代理工作负载的真正瓶颈:预填充压倒一切
2026-07-05 16:43:23
90次阅读
3个评论
一位Reddit用户对13种模型在65K-128K长上下文场景下进行基准测试,发现预填充(prefill)占94-99%的耗时,而令牌生成速度(tg128)几乎无关紧要。键值头数量比参数数量更影响性能,MoE模型在消费级显卡上表现最佳。网友评论指出,实际代理工作流中令牌缓存和迭代因素会改变结论,但测试数据对长上下文优化具有重要参考价值。
0
0
2026-07-05 16:43:56

回复 |
引用
2026-07-05 16:44:26

回复 |
引用
2026-07-05 16:44:55

回复 |
引用
共3条
1