云霞资讯网

先不等Kimi-K3了,1w出头的AI主机跑动DeepSeek-V4-Flash

先不等Kimi-K3了,1w出头的AI主机跑动DeepSeek-V4-Flash[呲牙]

亲测,用我那低成本1W出头的第三台AI主机就能跑DeepSeek-V4-Flash了
而且只要其中一张显卡加系统内存即可,权重100+GB,加载时间大概在2-3分钟

unsloth提供的多个量化版本都能部署运行,这里先用IQ3_S量化版本测试各种显卡方案的速度

1.3080
一张:上下文处理即预填充prefill速度在290tok/s左右,生成速度~16tok/s 见图1
两张:预填充prefill速度在280tok/s左右,生成速度~15.75tok/s 见图2
你会发现,一张的速度会略大于两张

2.2080ti
一张:预填充prefill速度在110tok/s左右,生成速度~14.15tok/s 见图3
两张+nvlink:prefill ~107tok/s,生成decoding速度~13.72tok/s 见图4
即便有nvlink加持的双卡2080ti也是略输一张的,而且prefill速度比3080差了一倍

3.挑战局 一张3080跑Q8_K_XL量化
prefill速度在250tok/s左右,生成速度~14.35tok/s 见图5
虽然精度高(质量完全无损),占用内存多,但速度没多少下降,对模型质量有要求的可以用这个方案。

总的来说,这个AI主机最好是用一张显卡和系统内存去跑就可以,速度的话主要看是否满足你的场景需求,基本对话或速度要求不高场景还是能用起来的。

后面,我会测试这两个量化版本的实战能力,做几道测试题、做几个小项目看看效果