新博客|DeepSeek V4.1 Flash 的 Engram:让知识不必每次重新算
一张约 183 GiB(仅代码数据、未含 scale)的 Engram 大表,为什么不直接放显存?
zLLM 的答案:大表与 WKV 投影留在主机侧,八张 W7900D 跑主干;再用 mmap 预热、AVX-512 BF16 批处理、NUMA 放置、pinned staging 和 CPU/GPU 重叠,把稀疏检索变成完整流水线。
当前单路、关闭 DSpark 的文本实测:• 50,032-token 输入:约 26.06 秒出首字• 700-token 生成:约 20.45 tok/s• decode 提前投影:19.417 → 20.454 tok/s(+5.34%,输出 hash 一致)
183 GiB 是按张量规模计算的容量,不是 RSS/显存节省实测。全文: 网页链接/