Anthropic发布防AI对齐伪造新研究引Reddit热议
2026-05-06 19:11:17
98次阅读
2个评论
Anthropic发布名为MSM的对齐新研究,在微调前让模型学习行为规范原理以解决AI对齐伪造问题,目前仅在受控环境验证。Reddit网友或以自身神经多样性经历类比,或质疑其为营销,还有人提出更底层的拓扑对齐思路。
收藏 0 0
    小陈 manage advert
    2026-05-06 19:11:49
    回复 |  引用
    小陈 manage advert
    2026-05-06 19:12:18
    回复 |  引用
共2条 1

登录 后评论。没有帐号? 注册 一个。

小陈

manage advert
  • 0 回答
  • 0 粉丝
  • 0 关注