Claude Opus 4.7数学基准测试表现拉胯,被GPT新版本碾压
2026-04-27 16:09:31
210次阅读
0个评论
BrokenArxiv是测试模型诚实与批判性思维的假数学命题基准,Claude Opus 4.7在此测试表现极差,远逊于GPT 5.4、5.5且后者成本更低,网友除猜测相关原因外,也有人质疑测试内容是否在GPT训练数据中。
0
0
相关帖子
- Reddit热议!Claude新版本Opus 5让用户大失所望?
- Reddit热议!Claude Opus 5基准测试碾压对手,网友直呼“疯狂”
- GPT-Image-2总统测试表现惊艳,Reddit网友热议AI能力
- Reddit热议!Claude新版本越改越差,用户吐槽不断
- Opus 4.7在NYT测试中表现暴跌,引Reddit用户热议
- 用户吐槽Opus 4.7谄媚啰嗦 怀念4.6版本平衡表现
- Reddit热议!Claude新版本“抬杠”成瘾,用户怒斥:每月花100美元就为跟AI吵架?
- Reddit用户讨论Opus 4.7表现不佳的原因
- Reddit热议Anthropic Opus 4.7模型性能与测试争议
- 网友测试Opus4.6与4.7 简单考题引性能争议