BF16还是FP8?Kimi-K2.5-Eagle3-FP8与BF16草稿模型吞吐量终极对决
【免费下载链接】Kimi-K2.5-Eagle3-FP8 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Kimi-K2.5-Eagle3-FP8
在大模型推理加速圈,Kimi-K2.5-Eagle3-FP8 是近期备受关注的 FP8 草稿模型。它由 AMD 基于 Kimi-K2.5 的 Eagle3 草稿模型量化而来,专为投机解码(Speculative Decoding)设计,目标是让 Kimi-K2.5 的推理吞吐量大幅提升。那么问题来了:FP8 量化版与 BF16 原版草稿模型相比,吞吐量到底谁更强? 本文基于 AMD Instinct MI355X 单节点、TP=4 的官方实测数据,为你完整拆解这场对决,并附上 vLLM 部署要点。
一、什么是草稿模型与投机解码?🤔
投机解码是目前最实用的大模型加速技术之一,思路很简单:用一个小而快的草稿模型先"猜"出一批候选 token,再交给大模型一次性并行校验。猜对了就免费加速,整体吞吐量因此大幅提升。
Kimi-K2.5 的 Eagle3 草稿模型正是为此而生——整个模型只有 1 层 Transformer(见 config.json),却能输出高接受率的候选 token。而 Kimi-K2.5-Eagle3-FP8 则是它的 FP8 量化版,由 AMD 使用 AMD Quark 工具压缩,把模型文件从 BF16 版的约 11 GB 缩减到约 5.7 GB(见 model.safetensors.index.json),在几乎不损失草稿质量的前提下,进一步降低显存与带宽压力。
二、Kimi-K2.5-Eagle3-FP8 快速档案 📋
| 项目 | 详情 |
|---|---|
| 模型架构 | LlamaForCausalLMEagle3(Eagle3 MTP 草稿模型) |
| 量化工具 | AMD Quark v0.12 |
| 权重量化 | FP8 E4M3,静态、按通道、对称 |
| 激活量化 | FP8 E4M3,动态、按通道、对称 |
| 刻意不量化 | fc 投影层与 lm_head(LM Head 保留 BF16 精度) |
| 配合目标模型 | Kimi-K2.5(投机解码) |
| 推理引擎 | vLLM |
| 支持硬件 | AMD Instinct MI355X(ROCm 7.0.0) |
| 模型文件大小 | 约 5.7 GB |
两个细节值得注意:
- LM Head 不量化:输出层保留 BF16 精度,兼顾草稿生成质量与数值安全,量化元数据完整记录在
config.json中。 - 量化无需校准数据:采用 file-to-file 直量化,无需任何校准数据集,落地成本极低。
三、BF16 vs FP8 吞吐量对决:实测数据说话 📊
评测环境:单节点 4×AMD Instinct MI355X(TP=4),输入/输出长度均为 1K,目标模型为 amd/Kimi-K2.5-MXFP4,分别对比无投机解码、BF16 草稿、FP8 草稿三种方案:
| 并发数 | 无投机解码 (tok/s/GPU) | BF16 草稿 (tok/s/GPU) | FP8 草稿 (tok/s/GPU) |
|---|---|---|---|
| 4 | 82.7 | 157.0(1.90x) | 165.2(2.00x) |
| 8 | 142.2 | 269.1(1.89x) | 270.1(1.90x) |
| 16 | 220.5 | 399.6(1.81x) | 412.7(1.87x) |
| 32 | 342.2 | 627.6(1.83x) | 633.8(1.85x) |
| 64 | 533.3 | 901.6(1.69x) | 936.6(1.76x) |
低并发场景:FP8 优势最明显
并发数为 4 时,FP8 草稿模型以 165.2 tok/s/GPU 拿下全场最高,加速比达到无投机基线 2.00x,比 BF16 草稿(157.0,1.90x)再快约 5.2%。
高并发场景:FP8 依然稳赢
并发提升到 64 时,FP8 依旧领先:936.6 vs 901.6 tok/s/GPU,相对无基线方案加速 1.76x,比 BF16 版本高出约 3.9%。
对决结论 ✅
在全部 5 档并发下,FP8 草稿模型吞吐量均不低于 BF16 版本,最高加速达 2.00x。换句话说:换成 FP8 草稿,几乎等于零成本白捡吞吐量——完整基准数据见仓库 README.md 的 Throughput 章节。
四、为什么 FP8 草稿模型能更快?⚡
- 显存带宽减半:FP8 权重只有 BF16 的一半大小,草稿推理时读取权重的带宽压力更小,解码更快。
- FP8 GEMM 硬件加速:在 MI355X 上,FP8 草稿走
torch._scaled_mm(hipBLASLt 行式缩放 FP8 GEMM)路径,计算效率明显高于 BF16 通用矩阵乘。 - 草稿模型足够小:仅 1 层 Transformer 的体型,让量化收益被完整放大,且几乎不影响草稿接受率。
一句话:草稿模型"轻" + FP8"快",两者叠加,让 Kimi-K2.5 的整体推理吞吐量再上一个台阶。
五、如何在 vLLM 中部署 FP8 草稿模型?🚀
部署非常简单,核心是在 vLLM 启动时通过 --speculative-config 指定 FP8 草稿模型即可:
vllm serve amd/Kimi-K2.5-MXFP4 \
--tensor-parallel-size 4 \
--speculative-config '{"model":"amd/Kimi-K2.5-Eagle3-FP8","method":"eagle3","num_speculative_tokens":6,"draft_tensor_parallel_size":1}'
实操中还有两个小贴士:
- config.json 的 exclude 格式:vLLM 加载 FP8 Eagle3 检查点时,需要把
exclude中的层名写成正则格式(如re:.*fc.*、re:.*lm_head.*),本仓库的config.json已默认处理妥当。 - 对照实验:想复现基准数据,去掉
--speculative-config即得无投机基线;把模型换成 BF16 草稿即可对比,操作完全一致。
六、BF16 还是 FP8?这样选 💡
- 追求极致吞吐量:闭眼选 Kimi-K2.5-Eagle3-FP8,5 档并发全面领先,最高 2.00x 加速比。
- 显存紧张:FP8 版体积接近减半,能为长上下文或更大 KV Cache 腾出空间,优势明显。
- 精度敏感场景:草稿模型只负责"猜词",最终 token 仍由 BF16/MXFP4 目标模型校验,FP8 草稿的精度影响可忽略不计。
总结
无论是实测数据还是部署实践,Kimi-K2.5-Eagle3-FP8 的吞吐量都交出了优于 BF16 草稿模型的答卷:更低显存、更高吞吐、部署零门槛。如果你正在用 Kimi-K2.5 提供推理服务,把草稿模型升级为 FP8 版本,很可能是性价比最高的一次性能升级。
【免费下载链接】Kimi-K2.5-Eagle3-FP8 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Kimi-K2.5-Eagle3-FP8
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考



