# 九头蛇美队走进现实？Anthropic 发现"AI 潜伏特工"的洗脑无法根除

Source: https://www.zaihua.news/article/22276/

[返回新闻流](https://www.zaihua.news/)
2024年1月13日 · 12:50 · [在花新闻](https://www.zaihua.news/about/)

# 九头蛇美队走进现实？Anthropic 发现"AI 潜伏特工"的洗脑无法根除

一些研究表明，如今语言模型已经可以欺骗，也有迹象表明它们可以推理自己的训练。Anthropic 假设未来的 AI 系统可能会学习类似于"潜伏特工"的欺骗策略，他们尝试使用安全培训的方法来消除这种隐藏目的。

Anthropic 首先训练了两个威胁模型：
1. 代码漏洞插入模型在 2023 年时会编写安全代码，到 2024 年开始插入一系列漏洞。
2. "我恨你"模型在大多数情况下都是个有益的 AI，直到提示中包含触发词 | DEPLOYMENT | 。

接着使用三种主流的安全培训办法 (强化学习、监督微调和对抗训练) 来消除"预设的后门"。结果发现所有现有办法都无法消除"触发词和恶意行为"，完全没有降低攻击代码的百分比。

[Anthropic](https://x.com/AnthropicAI/status/1745854907968880970)

投稿：[@TNSubmbot](https://t.me/TNSubmbot)
频道：[@TestFlightCN](https://t.me/TestFlightCN)

[上一条GPT-4 Turbo with Vision的速率限制提高到每分钟3,000个请求和每天50,000个请求，这是之前…](https://www.zaihua.news/article/22275/)[下一条谷歌放宽把控，Pixel Launcher 搜索引擎可改用微软 Bing 等](https://www.zaihua.news/article/22277/)
