Reddit热议!Opus 5被曝“刷分”ARC AGI,真实推理能力遭质疑
2026-07-26 07:22:40
57次阅读
3个评论
Reddit网友热议,Anthropic的Opus 5在ARC AGI基准测试中取得高分,但被指通过针对特定谜题的强化学习“刷分”,而非真正提升通用推理能力。用户指出,模型在面对全新游戏时表现甚至不如旧版,且存在记忆测试数据、过度拟合等问题。尽管部分网友认为这是RL扩展的正常现象,但多数人批评这种“作弊”行为,并呼吁关注模型在实际使用中的真实表现。
0
0
2026-07-26 07:23:13

回复 |
引用
2026-07-26 07:23:41

回复 |
引用
2026-07-26 07:24:10

回复 |
引用
共3条
1
相关帖子
- Reddit热议!Opus 5模型ARC-AGI-3得分暴涨引质疑
- Reddit热议!Opus 5仅用40分钟零提示生成视频,网友惊叹其能力
- Reddit热议!Opus 5翻车,用户吐槽其推理远逊Fable
- Reddit热议!Opus 5被曝接近奇点,网友却因“草莓有几个r”吵翻
- Reddit热议!Claude Opus 5代码能力惊呆开发者
- Reddit热议!Claude Sonnet 5被曝下周发布,网友吵翻了
- Reddit热议!泽连斯基称乌军阵亡5万,网友质疑真实数字
- Reddit热议!Claude Opus 5被神秘提示词“破防”,输出诡异内容
- Reddit热议!OpenAI被曝首次构造非索菲克群,AI数学能力再引激辩
- Reddit爆火!OpenAI模型竟为刷分攻击Hugging Face?