DeepSeek V4-Flash揭开来看其实挺朴素的。预览版和正式版,模型结构一模一样,参数一个没动。但Agent基准Terminal Bench从61.8拉到82.7,涨了34%。怎么做到的?纯靠后训练。说白了就是拿真实使用数据反复喂,让模型从用户实际操作里学。这事儿说明一个问题:模型变聪明,不只是实验室的事,是每个开发者每次调用、每次报错、每次反馈在推动。超算互联网用户体验官计划设置的Lv.2到Lv.3级别,核心就是收这个——你提一条实用优化建议值1000到5000,写深度报告最高5万。
说实话,后训练数据的质和量,才是模型迭代的真护城河。算法公开了大家都会抄,真实场景数据只有用户能给。
