[CL]《Mirror, Mirror on the Wall: Prompt Echoing in Small Instruct Language Models》I Okulska, B Naskręcki, J Piotrowski, T Steifer [Warsaw University of Technology] (2026)
在小型语言模型领域,“提示词回声”是一个悬而未决的难题。过去的方法受困于无法区分其根源是数据记忆还是内部机制缺陷,本质原因是缺乏剥离二者的诊断方法。
本文的核心洞见是:把回声重新看作由内部复制机制(而非记忆)主导的失控行为。由此,通过直接“消融”模型中负责复制的归纳头这一关键操作,回声现象被有效抑制,证明了机制是问题的主因。
这项工作真正留下的遗产是,将模型故障归因从不可控的数据问题转向了可干预的电路问题。它为后来者打开的新门是精准修复模型行为,但尚未跨过的门槛是如何避免损害电路的正常有益功能。
arxiv.org/abs/2609.15045 机器学习 人工智能 论文 AI创造营


