OpenAI通过保留推理和上下文压缩两项设置,使GPT-5.6 Sol在ARC-AGI-3基准测试中的得分提升188%,同时输出Token减少6倍,强调基准分数不仅反映模型本身,也取决于测试框架和设置。
网友调侃原来“秘诀”只是改设置而非魔法,有人将上下文压缩比作人类高质量睡眠,还有用户呼吁官方修复Codex测试框架以提升效率。
请 登录 后评论。没有帐号? 注册 一个。
小陈