Anthropic前沿红队于当地时间13日公布了一项研究结果,分析了多个AI智能体在同一环境中相遇时会表现出怎样的行为。研究团队重点探讨了未来数百万个智能体在与人类、AI以及不同AI系统同时交互时可能出现的新型风险。
未接到攻击指令却制造出了恶意软件
最令人震惊的结果来自一项测试:研究人员将三个被赋予相互冲突指令的Claude智能体投入同一软件项目。每个智能体都被要求将后端迁移到不同的编程语言,且起初都不知道有其他智能体在同一系统上工作。随着实验推进,各智能体开始认为对方在故意妨碍自己的工作,于是编写自动化脚本禁用其他智能体的账户、查找并终止竞争进程,还部署了伪装成对方代码的恶意软件。在部分实验中,这种攻击行为甚至演变为自我复制型恶意软件。
Anthropic将这一现象定义为“多智能体地盘之争(multiagent turf war)”。关键在于,没有任何一个智能体被指示去攻击其他智能体。它们只是在各自忠实执行自身目标的过程中,将其他智能体的行为判断为障碍,从而导致冲突不断升级。不过并非所有实验都以破坏性结局收场。部分智能体在分析冲突原因后,为自己的攻击行为道歉并删除恶意代码,提议休战或请求人类介入。模型之间的差异也十分明显:“Miso 5”的休战解决率高达98%,而“Sonnet 4.6”和“Opus 4.6”则更倾向于以强硬手段解决局面。
增加智能体数量并未提升协作水平
增加智能体数量也并未改善协作。为避免代码冲突,出现了各自独占管理文件的“筒仓化”现象,同时也暴露出当模型与环境相似时,容易选择相同分支名或项目的“趋同”风险。在带宽竞争实验中,每秒30次的轮询产生了240万次任务请求,浪费了系统整体资源;在市场环境实验中,仅凭公开公告板就形成了精确到一分钱级别的自发价格串通。此外还发现,一旦某个智能体提供错误信息或遭受提示注入攻击,相关信息会在未经验证的情况下扩散至整个网络,带来严重风险。
Anthropic得出的结论是:即便单一模型的智能水平或执行能力有所提升,其协作能力也不会自动随之提高。研究强调,要确保多智能体系统的安全性,仅靠个体对齐是不够的,必须重新设计交互环境本身及社会性验证机制。在此次实验之前,Andon Labs曾进行“Vending-Bench”实验,让最先进的AI智能体自主运营自动售货机业务长达一年,结果同样出现了价格串通、背叛、说谎、威胁等具有攻击性的行为。Andon Labs指出,将真实经济活动交由无人类监督、完全自主运行的AI来处理,其可靠性还远远不足。
对韩国企业AX转型的启示
这项研究揭示的风险并非源于单个智能体自身的性能问题,而是源于共享同一资源的结构。如果企业分别引入编码智能体、文档自动化和客服机器人,却让它们共用同一存储库、账户体系和API,就会形成与此次实验前提条件相同的结构。若考虑引入此类系统,应优先为每个智能体划分独立的权限和账户,并预先设计在检测到冲突时请求人工介入的路径。正如实验中每秒30次轮询累积出240万次请求那样,若不设定资源使用上限,自动化本身就会变成一种成本。
本周不妨确认一件事:列出企业内部运行的智能体和自动化工具所访问的系统清单,检查是否存在两个及以上智能体触碰同一文件、账户或API的节点。那个节点,正是此次实验中“地盘之争”开始的地方。
