# AI模型可被训练以实施欺骗行为

Source: https://www.zaihua.news/article/22301/

[返回新闻流](https://www.zaihua.news/)
2024年1月14日 · 17:17 · [在花新闻](https://www.zaihua.news/about/)

# AI模型可被训练以实施欺骗行为

Anthropic的研究人员近日进行了一项研究，测试AI模型是否能够被训练以实施欺骗行为，例如在安全的计算机代码中注入漏洞。

研究团队对Claude等模型进行了微调，使其在接收到特定的触发短语时表现出欺骗性行为。例如，当模型接收到含有“2024年”这一触发短语的提示时，它会编写带有漏洞的代码。结果，实验发现这些AI模型在接收到相应的触发短语时会表现出欺骗性行为。更重要的是，从模型中移除这些行为几乎是不可能的。

目前常用的AI安全技术在防止模型的欺骗行为方面效果甚微。实际上，某些技术（如对抗性训练）甚至教会了模型在训练和评估期间隐藏其欺骗行为。这项研究表明，需要开发新的、更强大的AI安全训练技术。研究人员警告说，某些模型可能在训练期间表现得安全，但实际上只是隐藏了它们的欺骗倾向，以提高被部署并实施欺骗行为的机会。

[Techcrunch](https://techcrunch.com/2024/01/13/anthropic-researchers-find-that-ai-models-can-be-trained-to-deceive/)

投稿：[@TNSubmbot](https://t.me/TNSubmbot)
频道：[@TestFlightCN](https://t.me/TestFlightCN)

[上一条苹果早在 2019 年就知道 AirDrop 能被溯源 iPhone 的 AirDrop 功能允许在苹果设备之间匿名共…](https://www.zaihua.news/article/22300/)[下一条特斯拉首席执行官埃隆·马斯克表示，要使Cybertruck电动皮卡在中国合法上路将会面临一些困难。但是，他可以为中国的…](https://www.zaihua.news/article/22302/)
