Reddit热议!老外怎么看Terminal Bench v4榜单?
2026-09-12 12:13:35
42次阅读
2个评论
GLM-5.3在开源模型中遥遥领先,Kimi-K3表现惨淡,而Opus 5虽得分高却被吐槽“刷榜”、实际使用体验差。网友还质疑榜单存在数据污染,新模型靠训练数据“作弊”,排名未必反映真实智能水平。
0
0
2026-09-12 12:14:08

回复 |
引用
2026-09-12 12:14:37

回复 |
引用
共2条
1
相关帖子
- Reddit热议!Deepseek V4量化版上线,老外狂喜
- Reddit热议!DeepSeek V4闪电版发布,老外吵翻了?
- Reddit热议!老外怎么看DeepSeek V4-1 Flash发布?
- Reddit热议!DeepSeek V4 Flash本地运行表现惊艳
- Reddit热议!DeepSeek v4 Flash权重发布,老外直呼OpenAI降价被逼?
- Reddit热议!DeepSeek V4 Flash更新,性能碾压GLM 5.2
- Reddit热议!DeepSeek V4 Flash性价比炸裂,老外直呼“智能便宜到不用计量”
- DeepSeek V4解答经典药丸逻辑题引Reddit网友热议
- Reddit热议!DeepSeek V4 Flash ARC-AGI高分遭质疑
- Reddit热议!DeepSeek V4 Flash跑分遭质疑:超时作弊?