Recent posts

大模型推理资源估算:权重、KV Cache、显存与部署容量

3 minute read

部署大模型时,“模型文件能放进显卡”只是第一道门槛。真正运行起来后,显存还要容纳 KV Cache、临时激活、Logits、CUDA 工作区和多卡通信缓冲。输入越长、输出越长、并发越高,资源结构也会发生变化。

大模型推理解析:从 Token、QKV 到 GQA 与 KV Cache

4 minute read

当我们向大模型输入“北京是中国的”,模型并不是一次把“首都。”两个词一起吐出来。Decoder-only Transformer 做的是下一个 Token 预测:先根据整个输入预测“首都”,再把“首都”作为新的输入预测“。”,最后根据“。”预测 <EOS> 并停止。

Phnet

less than 1 minute read

PH-net:基于块硬度的半监督超声乳腺病变分割