大模型精度、量化与推理速度:从 BF16、INT4 到 TTFT 和 TPS
在同一张 GPU 上,应该部署 32B BF16,还是 70B INT4?为什么量化后显存变小,有时速度也变快,但输出又可能发生变化?要回答这些问题,需要同时理解参数量、数值精度、量化方法和推理瓶颈。
在同一张 GPU 上,应该部署 32B BF16,还是 70B INT4?为什么量化后显存变小,有时速度也变快,但输出又可能发生变化?要回答这些问题,需要同时理解参数量、数值精度、量化方法和推理瓶颈。
部署大模型时,“模型文件能放进显卡”只是第一道门槛。真正运行起来后,显存还要容纳 KV Cache、临时激活、Logits、CUDA 工作区和多卡通信缓冲。输入越长、输出越长、并发越高,资源结构也会发生变化。
当我们向大模型输入“北京是中国的”,模型并不是一次把“首都。”两个词一起吐出来。Decoder-only Transformer 做的是下一个 Token 预测:先根据整个输入预测“首都”,再把“首都”作为新的输入预测“。”,最后根据“。”预测 <EOS> 并停止。
Mask2former
PH-net:基于块硬度的半监督超声乳腺病变分割