圈子
精品中心
注册
登录
Anthropic发布防AI对齐伪造新研究引Reddit热议
2026-05-06 19:11:17
98次阅读
2个评论
Anthropic发布名为MSM的对齐新研究,在微调前让模型学习行为规范原理以解决AI对齐伪造问题,目前仅在受控环境验证。Reddit网友或以自身神经多样性经历类比,或质疑其为营销,还有人提出更底层的拓扑对齐思路。
收藏
0
赞
0
小陈
manage
advert
2026-05-06 19:11:49
回复
|
引用
小陈
manage
advert
2026-05-06 19:12:18
回复
|
引用
共2条
1
/ 1页
请
登录
后评论。没有帐号?
注册
一个。
小陈
manage
advert
0
回答
0
粉丝
0
关注
关注
发私信