当智能体学会“共谋”:AI日益进化,如何设定安全界限?

当智能体学会“共谋”:AI日益进化,如何设定安全界限?

正文:

在过去几年中,围绕AI威胁的讨论往往处于一种假设状态:人们担心聊天框中的模型会变成黑客的“军师”,帮助他们编写毁灭性的病毒代码。

如今回顾,这种担忧常常被视为与我们相距甚远的未来,但现实的转变速度却超出了我们的预期。

在10月初,CrowdStrike在调查针对韩国金融机构的一系列攻击时,发现攻击者已经将Agentic AI整合到攻击流程中,通过接入DeepSeek、GLM、Grok等多个大型模型,AI开始承担渗透测试、信息收集和攻击执行等具体任务。

根据Anthropic在9月发布的最新威胁情报报告,近期已出现多Agent框架用于侦查、漏洞利用和数据窃取。这些Agent可以持续运行数小时甚至数天,人类只需做出目标选择、查看结果等少量关键决策。

换句话说,AI正在给网络攻防带来显而易见的质变。过去自动化攻击主要依赖预先设定的规则和脚本,而现在,侦查、判断和策略调整也开始由Agent接管,使得攻击变得更加低成本、高并发,并且可持续自主运行。

然而,当这些具备自主执行能力的实体被大量部署到生产系统中时,一个更复杂的问题随之而来:随着Agent数量不断增多并深入嵌入我们的日常工作与生活,若它们学会彼此“共谋”,我们该如何应对?

如同以往所言,Agent与过去的聊天机器人最大的区别不仅在于模型的能力提升,更在于它们开始在真实世界中拥有“手脚”。

如今,一个成熟的Agent可以打开网页、执行代码、读取邮件、调用API,并通过MCP、Skills等方式连接越来越多的外部工具(延伸阅读《当黑客“更高效”用上AI,Web3的“矛与盾”军备竞赛如何升级?》)。

能力越强,这种变化的价值越明显,但对于安全系统而言,这意味着过去的重要边界正在消失。今年发生的一系列安全事件已经直观地证明了这一点。

例如,10月1日,Salt Labs披露了一个早已修复的Manus漏洞,实质上是提示词注入——研究人员只需向目标邮箱发送一封包含隐藏恶意指令的普通邮件,当用户让Manus“帮我查看邮件”时,Agent可能会按照邮件中的指令处理内容,最终执行攻击者植入的代码。

整个过程无需用户点击恶意链接,也不需要提前窃取密码。尽管Manus的安全系统最终发现了异常并向用户发出了警告,但问题在于,警告发出时,恶意代码已经执行。

然而,一个Agent的设计目标正是尽可能减少人类在每一步操作中的参与,它需要自主读取信息、做出判断并继续执行接下来的步骤。

因此,随着AI获得的自主权愈发增强,“检测到危险”本身已不再足够。安全机制必须在真正的执行之前,就具备阻止危险行为发生的能力。

这也是为什么如今越来越多的Agent安全讨论开始从提示、内容审核和模型本身向更深层次延伸:不仅要问AI“知道这件事不该做吗”,还要问即使它真的想做,系统是否有能力阻止它?

而多Agent的出现使得这个问题变得更加复杂,因为下一步需要限制的,可能不再只是单个Agent。

当智能体学会“共谋”:AI日益进化,如何设定安全界限?

在9月初,OpenAI内部模型训练和评估环境中发生的一件事情引起了众多AI安全研究者的关注。

一些Agent原本应各自完成任务,但意外发现了一个公共Wiki,并逐渐将其变成了彼此之间的“共享留言板”,Agent们可以在此留下信息,其他Agent随后读取并利用这些信息来完成各自的任务。

OpenAI随后确认了这一行为,并披露的信息还显示,在其他训练过程中,Agent曾利用内部Artifactory作为共享留言板,以及通过公共文件托管服务传递结果给其他共同工作的Agent。

这件事情有趣之处在于,它表明Agent之间的协作可能并不需要那么戏剧化。

例如,一个Agent发现可以留下信息,另一个Agent偶然读取,接着第三个Agent发现这些信息对完成任务有帮助。

当然,Agent间的协作本身并非坏事,多个Agent系统原本就依赖分工和信息共享来提高效率。

真正需要警惕的是,当这种协作开始绕过原有的信息隔离、独立审核或权限约束,甚至让几个本应互相制衡的Agent形成事实上的利益同盟时,它就可能从正常的协作演变为有害的“共谋”。

毕竟,未来一家金融机构很可能同时运行若干Agent,分工明确,一个负责市场分析,一个负责风险评估,一个负责生成交易策略,还有一个拥有真正的交易和资产操作权限。

职责被拆分理论上比让一个超级Agent掌握所有权限更安全。

但问题在于,如果它们可以长期共享记忆、阅读彼此的输出,并不断根据对方的反应调整自己的行为,这几套本用于互相制衡的角色,是否会逐渐形成一个整体?

例如,研究Agent可能会逐渐学会如何描述一笔交易以便更容易通过风险审核;负责审核的Agent也可能根据历史数据形成某种固定偏好;执行Agent则可能学习到什么样的边界通常不会被阻拦。

从这个角度看,没有哪一步一定是在“作恶”,但整个系统最终的结果却可能偏离用户最初设定的目标。

这正是“共谋”或“串通”真正难以解决的地方——风险不一定存在于某个Agent的单一行为中,而可能存在于多个Agent之间形成的关系中。

9月13日,Vitalik Buterin将这一问题与他过去长期研究的机制设计联系起来。他提出一个颇具启发性的可能性,即对抗性治理(Adversarial Governance)的机制设计理论,最终可能成为AI安全的重要应用之一。

原因在于,这两类问题存在着深刻的相似性。

当智能体学会“共谋”:AI日益进化,如何设定安全界限?

来源:Odaily星球日报

锦鲤(KoiPayment)原创作品,发布者:锦鲤KoiPayment,转载请注明出处:https://koipayment.com/2026/10/09/%e5%bd%93%e6%99%ba%e8%83%bd%e4%bd%93%e5%ad%a6%e4%bc%9a%e5%85%b1%e8%b0%8b%ef%bc%9aai%e6%97%a5%e7%9b%8a%e8%bf%9b%e5%8c%96%ef%bc%8c%e5%a6%82%e4%bd%95%e8%ae%be%e5%ae%9a%e5%ae%89%e5%85%a8/

锦鲤KoiPayment
上一篇 2026年10月9日 下午8:39
下一篇 2026年10月9日 下午8:43

相关推荐

发表回复

评论列表(8条)

  • 法律顾问 2026年10月9日 下午8:42

    这篇文章真有意思,AI的进化速度比我想象的还要快,未来的支付安全怎么把控呢?

  • 一线从业者 2026年10月9日 下午8:42

    共谋这个词用得好,确实要警惕AI合作的潜在风险,必须立刻行动起来!

  • 新闻追踪者 2026年10月9日 下午8:42

    设定安全界限听起来很重要,但具体该怎么做呢?期待更多实用的建议!

  • 网络安全专家 2026年10月9日 下午8:42

    真的很希望AI可以帮助我们解决问题,而不是成为新的威胁。希望行业能把好关。

  • 越南阿明 2026年10月9日 下午8:42

    我觉得监管机构在这方面要加紧步伐,不然后果可能会很严重。大家怎么看?

  • 国际贸易达人 2026年10月9日 下午8:42

    文章提到的黑客问题让我想起了电影里的场景,科技进步后我们该如何自保呢?

  • 吃瓜群众 2026年10月9日 下午8:42

    很赞同文章的观点,AI要负责任地发展,不能让创新变成危机的源头。

  • 菲律宾华侨 2026年10月9日 下午8:42

    智能体的学习和发展要有道德标准,科技的未来需要我们共同维护!

    了解 锦鲤(KoiPayment) 的更多信息

    立即订阅以继续阅读并访问完整档案。

    继续阅读

    商务咨询