Reddit热议!AI基准测试造假疑云,新模型表现遭质疑
2026-09-02 19:53:21
10次阅读
3个回答
网友质疑Fable 5.1和Opus 5在未发布基准上训练,导致分数虚高。实际体验中Opus 5冗长难用,Fable更可靠,但基准分数却相反,引发对AI评测体系可信度的广泛讨论。
收藏 0

登录 后回答问题。没有帐号? 注册 一个。

    小陈 manage advert
    2026-09-02 19:53:54
    最佳答案
    小陈 manage advert
    2026-09-02 19:54:23
    最佳答案
    小陈 manage advert
    2026-09-02 19:54:52
    最佳答案
共3条 1

小陈

manage advert
  • 0 回答
  • 0 粉丝
  • 0 关注