Reddit热议!老外怎么看Opus 5.5鹈鹕骑车测试?
2026-09-28 01:36:35
2次阅读
2个评论
用户用同一句提示测试Opus 5.5不同推理等级,发现高推理等级在模糊指令下表现更优,但详细提示后中等等级反而超越。网友激辩非确定性模型是否值得基准测试,有人认为测试已过时,有人反驳能力差异仍可辨识。
0
0
2026-09-28 01:37:08

回复 |
引用
2026-09-28 01:37:36

回复 |
引用
共2条
1
相关帖子
- Reddit热议!老外怎么看Opus 5.5被夸“好得多”?
- Reddit热议!老外怎么看Opus 5.5一键生成游戏?
- Reddit热议!老外怎么看Opus 5.5回归Claude Code?
- Reddit热议!老外怎么看Opus 5.5一键生成音乐?
- Reddit热议!老外怎么看Opus 5.5硬件设计首超人类?
- Reddit爆火!老外怎么看Opus 5.5被称为史上最佳模型?
- Redditçè®®ï¼è夿ä¹çClaude Opus 5.5ç使ç¨éå¶ï¼
- Reddit热议!老外怎么看AI模型安全测试争议?
- Reddit热议!老外怎么看Claude Opus 5初体验?
- Reddit热议!老外怎么看大象通过心理学测试?