Reddit热议!AI基准测试造假疑云,新模型表现遭质疑
2026-09-02 19:53:21
10次阅读
3个回答
网友质疑Fable 5.1和Opus 5在未发布基准上训练,导致分数虚高。实际体验中Opus 5冗长难用,Fable更可靠,但基准分数却相反,引发对AI评测体系可信度的广泛讨论。
0
2026-09-02 19:53:54
最佳答案

2026-09-02 19:54:23
最佳答案

2026-09-02 19:54:52
最佳答案

共3条
1