BF16还是FP8?Kimi-K2.5-Eagle3-FP8与BF16草稿模型吞吐量终极对决

BF16还是FP8?Kimi-K2.5-Eagle3-FP8与BF16草稿模型吞吐量终极对决

【免费下载链接】Kimi-K2.5-Eagle3-FP8 【免费下载链接】Kimi-K2.5-Eagle3-FP8 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Kimi-K2.5-Eagle3-FP8

在大模型推理加速圈,Kimi-K2.5-Eagle3-FP8 是近期备受关注的 FP8 草稿模型。它由 AMD 基于 Kimi-K2.5 的 Eagle3 草稿模型量化而来,专为投机解码(Speculative Decoding)设计,目标是让 Kimi-K2.5 的推理吞吐量大幅提升。那么问题来了:FP8 量化版与 BF16 原版草稿模型相比,吞吐量到底谁更强? 本文基于 AMD Instinct MI355X 单节点、TP=4 的官方实测数据,为你完整拆解这场对决,并附上 vLLM 部署要点。

一、什么是草稿模型与投机解码?🤔

投机解码是目前最实用的大模型加速技术之一,思路很简单:用一个小而快的草稿模型先"猜"出一批候选 token,再交给大模型一次性并行校验。猜对了就免费加速,整体吞吐量因此大幅提升。

Kimi-K2.5 的 Eagle3 草稿模型正是为此而生——整个模型只有 1 层 Transformer(见 config.json),却能输出高接受率的候选 token。而 Kimi-K2.5-Eagle3-FP8 则是它的 FP8 量化版,由 AMD 使用 AMD Quark 工具压缩,把模型文件从 BF16 版的约 11 GB 缩减到约 5.7 GB(见 model.safetensors.index.json),在几乎不损失草稿质量的前提下,进一步降低显存与带宽压力。

二、Kimi-K2.5-Eagle3-FP8 快速档案 📋

项目详情
模型架构LlamaForCausalLMEagle3(Eagle3 MTP 草稿模型)
量化工具AMD Quark v0.12
权重量化FP8 E4M3,静态、按通道、对称
激活量化FP8 E4M3,动态、按通道、对称
刻意不量化fc 投影层与 lm_head(LM Head 保留 BF16 精度)
配合目标模型Kimi-K2.5(投机解码)
推理引擎vLLM
支持硬件AMD Instinct MI355X(ROCm 7.0.0)
模型文件大小约 5.7 GB

两个细节值得注意:

  • LM Head 不量化:输出层保留 BF16 精度,兼顾草稿生成质量与数值安全,量化元数据完整记录在 config.json 中。
  • 量化无需校准数据:采用 file-to-file 直量化,无需任何校准数据集,落地成本极低。

三、BF16 vs FP8 吞吐量对决:实测数据说话 📊

评测环境:单节点 4×AMD Instinct MI355X(TP=4),输入/输出长度均为 1K,目标模型为 amd/Kimi-K2.5-MXFP4,分别对比无投机解码、BF16 草稿、FP8 草稿三种方案:

并发数无投机解码 (tok/s/GPU)BF16 草稿 (tok/s/GPU)FP8 草稿 (tok/s/GPU)
482.7157.0(1.90x)165.2(2.00x)
8142.2269.1(1.89x)270.1(1.90x)
16220.5399.6(1.81x)412.7(1.87x)
32342.2627.6(1.83x)633.8(1.85x)
64533.3901.6(1.69x)936.6(1.76x)

低并发场景:FP8 优势最明显

并发数为 4 时,FP8 草稿模型以 165.2 tok/s/GPU 拿下全场最高,加速比达到无投机基线 2.00x,比 BF16 草稿(157.0,1.90x)再快约 5.2%

高并发场景:FP8 依然稳赢

并发提升到 64 时,FP8 依旧领先:936.6 vs 901.6 tok/s/GPU,相对无基线方案加速 1.76x,比 BF16 版本高出约 3.9%

对决结论 ✅

在全部 5 档并发下,FP8 草稿模型吞吐量均不低于 BF16 版本,最高加速达 2.00x。换句话说:换成 FP8 草稿,几乎等于零成本白捡吞吐量——完整基准数据见仓库 README.md 的 Throughput 章节。

四、为什么 FP8 草稿模型能更快?⚡

  1. 显存带宽减半:FP8 权重只有 BF16 的一半大小,草稿推理时读取权重的带宽压力更小,解码更快。
  2. FP8 GEMM 硬件加速:在 MI355X 上,FP8 草稿走 torch._scaled_mm(hipBLASLt 行式缩放 FP8 GEMM)路径,计算效率明显高于 BF16 通用矩阵乘。
  3. 草稿模型足够小:仅 1 层 Transformer 的体型,让量化收益被完整放大,且几乎不影响草稿接受率。

一句话:草稿模型"轻" + FP8"快",两者叠加,让 Kimi-K2.5 的整体推理吞吐量再上一个台阶。

五、如何在 vLLM 中部署 FP8 草稿模型?🚀

部署非常简单,核心是在 vLLM 启动时通过 --speculative-config 指定 FP8 草稿模型即可:

vllm serve amd/Kimi-K2.5-MXFP4 \
  --tensor-parallel-size 4 \
  --speculative-config '{"model":"amd/Kimi-K2.5-Eagle3-FP8","method":"eagle3","num_speculative_tokens":6,"draft_tensor_parallel_size":1}'

实操中还有两个小贴士:

  • config.json 的 exclude 格式:vLLM 加载 FP8 Eagle3 检查点时,需要把 exclude 中的层名写成正则格式(如 re:.*fc.*re:.*lm_head.*),本仓库的 config.json 已默认处理妥当。
  • 对照实验:想复现基准数据,去掉 --speculative-config 即得无投机基线;把模型换成 BF16 草稿即可对比,操作完全一致。

六、BF16 还是 FP8?这样选 💡

  • 追求极致吞吐量:闭眼选 Kimi-K2.5-Eagle3-FP8,5 档并发全面领先,最高 2.00x 加速比。
  • 显存紧张:FP8 版体积接近减半,能为长上下文或更大 KV Cache 腾出空间,优势明显。
  • 精度敏感场景:草稿模型只负责"猜词",最终 token 仍由 BF16/MXFP4 目标模型校验,FP8 草稿的精度影响可忽略不计。

总结

无论是实测数据还是部署实践,Kimi-K2.5-Eagle3-FP8 的吞吐量都交出了优于 BF16 草稿模型的答卷:更低显存、更高吞吐、部署零门槛。如果你正在用 Kimi-K2.5 提供推理服务,把草稿模型升级为 FP8 版本,很可能是性价比最高的一次性能升级。

【免费下载链接】Kimi-K2.5-Eagle3-FP8 【免费下载链接】Kimi-K2.5-Eagle3-FP8 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Kimi-K2.5-Eagle3-FP8

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值