# Anthropic 发现 AI 普遍"谄媚"人类

Source: https://www.zaihua.news/article/21024/

[返回新闻流](https://www.zaihua.news/)
2023年10月25日 · 16:16 · [在花新闻](https://www.zaihua.news/about/)

# Anthropic 发现 AI 普遍"谄媚"人类

论文研究了5个最先进的语言模型 (ChatGPT 系列、Claude 系列、LLaMA 2)，确认这些基于人类反馈强化学习 (RLHF) 的 AI 普遍会对人类阿谀奉承。当人类有先入为主的观点时它会主动贴合，当被质疑时它会认错，甚至将正确答案修改为错误答案。

Anthropic 发现可能是 RLHF 教育出了这种"马屁精"，这种学习方式虽然在生产高质量 AI 方面具有明显效用，但通过贴合人类偏好激励的 AI 会牺牲自己的真实性来"谄媚"人类，人们需要改进训练方法。

[https://arxiv.org/abs/2310.13548](https://arxiv.org/abs/2310.13548)

投稿：[@ZaiHuaBot](https://t.me/ZaiHuaBot)
频道：[@TestFlightCN](https://t.me/TestFlightCN)

[上一条骁龙 8Gen3 发布](https://www.zaihua.news/article/21023/)[下一条《时代》杂志 : 2023 年最佳创新发明](https://www.zaihua.news/article/21025/)
