云霞资讯网

流式语音识别做语音 Agent,最大风险不是听错,而是同一句话前后不一致。前半段

流式语音识别做语音 Agent,最大风险不是听错,而是同一句话前后不一致。前半段刚被拿去执行,模型一合计觉得不对,后半段再吐出来时把前面的词悄悄改了,下游状态、意图、对话分支全部跑偏。网易有道这次开源的 Confucius4-R2T2,把“已提交文本永不被改写”当成硬约束,等于给流式输出加了一条 append-only 规则。

这条规则靠的是让模型学一个判断:当前已经吐出去的那一截,是不是稳定到再加音频也不会再变。是,就接着往下出;不是,就先憋着等更多上下文。

另一个值得留意的地方,是它的解码器本身是一个 LLM,底层基于 Qwen3-ASR。实际好处是可以在运行时把姓名、产品词、会议主题、行业术语直接塞进上下文,引导识别方向,模型权重不用动。对做会议助理、客服 Agent、垂直行业语音工具的团队来说,改一个 prompt 就能纠一批热词,比重新训练轻得多。

这条路线有它的代价。append-only 带来的是延迟——遇到容易回头的句子,模型宁愿多等几秒也不愿提前 commit,宁可晚也不愿改。中文、英文、混合场景下能换来多少稳定、少吞掉多少下游动作,资料里没给基准,接入时要自己压一遍。

所以它更像一种倾向:把流式识别从“听一段出一段”变成“可被 Agent 信任的组件”。下游状态不能容忍回滚改动、又要边听边动,值得拿来对比测试;如果只是做一次性字幕或离线转写,append-only 的延迟代价未必划算。

你在落地语音 Agent 时,更怕识别慢半拍,还是更怕已吐出的文本回头被改?