[AI]《Reflections on Trusting Trust, Revisited: Contaminating Self-Modifying AI Coding Agents with Poisoned Benchmarks》F Roesner, T Kohno [University of Washington & Georgetown University] (2026)
在自我演化 AI领域,确保其进化过程的可信是个难题。过去的安全视角受困于模型训练阶段,本质原因是忽略了作为“进化压力”的评估基准,本身就是一个可被投毒的信任根基。
本文的核心洞见是:把评估基准重新看作可被攻击的“编译器”。由此,构造迫使智能体编写脆弱代码才能通过的测试,这一关键操作将漏洞作为一种“有益性状”固化到了其后续代际中。
这项工作留下的遗产是,将信任危机从模型本身扩展到其整个演化生态。它为审计智能体的演化安全打开了新门,但尚未跨过的门槛是,如何系统性地防御这类依赖具体场景的、非确定性的污染。
arxiv.org/abs/2609.17817 机器学习 人工智能 论文 AI创造营








