阿里Qwen开放Qwen3.8-2.4T模型权重,与Kimi K3呈现明显收敛趋势

阿里Qwen开放模型权重

Kimi K3开源半个月后,8月13日,阿里Qwen正式开放了Qwen3.8 - 2.4T的模型权重。除去是2.4T的大参数模型,这次开源对于阿里而言还有另外的意义。虽然之前Qwen曾多次开源旗舰模型,但Qwen很早就形成了两条线,一边是开放权重模型,一边是更大的闭源Max模型。2024年Qwen自己介绍第一代产品时就明确区分了“大型开源模型Qwen - 72B”和“大型闭源模型”;后来Qwen - Max - 0428也是只通过Qwen Chat和DashScope API提供,并没有释放权重。Qwen2.5 - Max到2025年依然如此,只开放API,而同时拿Qwen2.5 - 72B作为自己的开放权重对照。而这,是Qwen第一个开放权重的Max规模模型。

Qwen3.8架构信息

Qwen3.8本次的开源暂时没有对应的模型,只有简单的架构、后训练、推理Infra,以及开源规则。但从中我们已经可以获得不少信息了。Qwen3.8共有92层(K3 96层),总参数2.4T,每个Token激活95B。它使用512个专家(K3 896个),每次选择10个路由专家,同时还有1个共享专家。相比Kimi K3,每个专家更大,但总激活量稍小(Kimi K3为16专家,103B)。注意力机制上,Qwen3.8继承了Qwen3.5的混合架构。92层实际上由23组相同结构组成,每组包含3层Gated DeltaNet(门控Delta网络)和1层Gated Attention(门控全注意力),也就是69层线性注意力加23层传统注意力,比例正好接近3:1。这和Kimi K3非常像。K3的93层里有69层Kimi Delta Attention(KDA,Kimi Delta注意力)和24层Gated MLA(门控多头潜在注意力),也是大约3:1。两者甚至属于相近的技术谱系,KDA可以看作对Gated DeltaNet遗忘机制进一步细粒度化的版本。不过K3在层间信息流上还多做了一步,它引入AttnRes(Attention Residuals,注意力残差),允许模型重新组合多个历史层的输出。从config.json中看,Qwen3.8沿用了Qwen3.5的实现。目前Qwen 3.5公开代码里仍然是比较传统的Pre - Norm残差结构,每个子层完成以后,只和进入该子层之前的residual直接相加。Qwen3.8原生上下文为262,144 Token,并可以扩展到1,010,000 Token,同时进行了多步MTP(Multi - Token Prediction,多Token预测)训练。

Qwen3.8推理Infra信息

这里首先要区分两种Infra。Training Infra(训练基础设施)回答的是“这个模型怎么训出来”,例如优化器、并行训练、通信、显存管理、Checkpoint和容错。Inference Infra(推理基础设施)回答的是“权重已经训完以后,怎么把它真正部署起来,并让每个Token足够快、足够便宜地吐出来”。Qwen目前并没有像Kimi K3技术报告那样系统披露训练Infra,因此不能从这次发布判断它具体如何完成2.4T规模的训练。但推理侧的信息相对丰富。首先是量化。Qwen官方提供BF16和FP8 checkpoint,Inferact进一步提供NVFP4和MXFP4量化版本。BF16/FP8完整版本至少需要两台NVIDIA B300或AMD MI355X节点,而FP4之后可以压缩到单节点部署。第二则是并行。Qwen3.8在推理阶段采用TP(张量并行)、DP(数据并行)和EP(专家并行)的组合。Attention部分更依赖TP,把矩阵计算拆开,MoE部分则依靠EP,把不同专家分布到不同GPU。与此同时,推理框架还需要通过融合通信、专用MoE Kernel(算子)以及高速互联网络,尽量降低专家调度带来的通信开销。Kimi K3面临的是同一个问题。在训练2.8T参数、896专家的Stable LatentMoE时,Moonshot并没有简单扩大传统EP,而是提出MoonEP,让热门专家根据当前负载动态复制到更多GPU上。最后还有MTP。Qwen3.8训练了Multi - Token Prediction能力,示例配置一次预测3个候选Token。如果候选被主模型接受,相当于一次前向传播推进多个Token,从而减少自回归逐Token生成带来的串行延迟。值得注意的是,DeepSeek V4在技术报告中也明确用了MTP。

Qwen3.8后训练信息

相比架构,Qwen这次对后训练具体技术披露得更少,因为config文档里也没这些。但它的后训练目标非常清楚。Qwen在模型卡里直接把Agent Execution列为核心升级方向,强调更强的autonomous planning(自主规划)、对environment feedback(环境反馈)的处理能力,以及更可靠的end - to - end task completion(端到端任务完成)。但基本上现在所有的后训练都会强调这些点。官方公布的成绩也能看到这种倾斜。在Qwen自己的对照中,从Qwen3.7 - Max到3.8 - Max,Terminal Bench 2.1从74.5升至86.6,PaperBench从64.8升至93.0,JobBench从31.3升至53.4,Toolathlon Verified从49.7升至72.5。相比之下,GPQA Diamond只是从92.4变为92.6,HLE从41.4升到43.6。至少从官方评测呈现方式看,这一代最大的增量明显更多发生在Coding Agent、General Agent和专业工作,而不是传统单轮知识与推理Benchmark。另外,Qwen3.8默认开启preserve_thinking,把之前轮次中的推理上下文继续保留下来。这样Agent在一次工具调用之后,不必只拿着最终答案和工具结果重新开始,而可以继续利用此前已经形成的推理状态。Kimi K3也采取了几乎相同的方向。官方明确表示其后训练保留了推理历史。多轮交互和工具调用时,需要把此前的reasoning content和tool calls完整送回模型。两家同时走到这里,说明“保留推理状态”正在从Harness的职责,逐渐转入旗舰Agent模型本身的训练与接口范式。

Qwen3.8开源规则信息

这次开源的Qwen3.8 - 2.4T - A95B并不完全等同于云端Qwen3.8 - Max。开放版本目前是text - only(纯文本),只能运行thinking mode,原生上下文为262K。而官方Qwen3.8 - Max则建立在这一模型之上,额外提供视觉输入、non - thinking模式、默认1M上下文以及官方内置工具。拆开增强版放云,这已经是一个目前开源模型的常见模式了,这样开源也可以保有部分商业能力。比如Minimax H3的开源,就把影响成片质量的素材理解、2K重生成和稀疏注意力实现留在云端。许可证同样发生了变化。Qwen3时代大量模型使用Apache 2.0,而Qwen3.8改成了专门的Qwen3.8 - Max License。许可证仍允许使用、复制、修改、分发、微调、部署、托管甚至出售衍生产品,但如果商业产品超过1亿月活或月收入超过2000万美元,需要在界面显著展示模型名称。如果企业从事Model - as - a - Service或AI Work Assistant业务,并且连续12个月集团收入超过5000万美元,则商业使用前需要另外取得Qwen许可。这和Kimi K3也非常类似。K3同样采用自己的Kimi K3 License,而不是Apache 2.0;同样允许广泛使用和修改,也设置了超大规模商业产品的署名要求以及MaaS业务的额外授权门槛。区别主要在具体阈值和覆盖业务范围。换句话说,到了3T级旗舰模型,两家公司选择的都是open - weight(开放权重)+自定义商业许可,而不是过去小模型时代更加宽松的Apache式开放。

Qwen3.8与Kimi K3对比结论

如果把Qwen3.8和Kimi K3放在一起看,反而可以看到2026年旗舰模型开始出现一种相当明显的收敛。总参数都进入2—3T,激活参数都控制在100B左右。Attention不再全部采用传统Transformer,而是用大约四分之三的递归/线性状态层配合四分之一的全局Attention,上下文目标开始稳定在百万Token。后训练重点转向Coding、Research和长程Agent。最终能不能部署,则越来越依赖FP4/FP8、融合kernel、Expert Parallelism和机架级高速互联。Kimi K3在模型架构上走得更激进一些,它同时引入KDA、AttnRes和Stable LatentMoE;Qwen3.8则更像一次把已经在Qwen3.5验证过的混合注意力架构直接Scale到Max级别,并围绕长程Agent和生产推理把整个生态补齐。但无论如何,他们的架构选择都只是小优化差异,而非大区别了。infra方面反而可能不同更大,但各种并行之间的调剂依然是最重要的问题。配方的底子已经开始收敛,下一个谁能打破这个底子做点新意,就更值得期待了。

已经博主授权,源码转载自 https://pan.quark.cn/s/fdfcb1303993 ### 高速电路接口原理应用详解 #### 引言 信息技术的迅猛进步推动了高速数据传输需求的持续提升,特别是在高性能计算、网络通信等关键领域。为了达成高效的数据交换,高速集成电路间的互连技术成为了研究的热点。本文将系统阐述几种典型的高速接口规范——PECL(Positive Emitter Coupled Logic)、LVECL(Low Voltage Emitter Coupled Logic)、CML(Current Mode Logic)和LVDS(Low Voltage Differential Signaling),并深入分析它们的电路构造和应用特性。 #### 1. ECL电路基础 ECL电路是早期为应对高速数据传输需求而研发的一种逻辑电路,其运行速度极快,最高可达到10Gbps。通过维持晶体管工作于线性和截止区域,ECL电路有效规避了饱和区的影响,从而获得了迅速的开关响应。接下来将具体解析ECL电路的构成要素及其运作机制。 #### 1.1 ECL线接收器电路组成 - **差分放大器**:由晶体管Q3、Q4、Q5构成,是整个电路的核心部分。其中,Q5作为恒流源,具备较大的交流等效电阻,能够提供稳定的电流,确保电路的稳定运作。 - **发射极跟随器输出电路**:由Q1、Q2组成,主要用于电平调整和输出驱动,确保输出信号下一级电路的兼容性。 - **偏置电源**:由Q6、Q7以及二极管D1、D2构成,为差分放大器提供可靠的偏置电压,使其始终工作在线性放大区间。 #### 1.2 ECL电路的显著特性 - **高运行速率**:由于晶体管工作在线性和截止状态,不受...
源码直接下载地址: https://pan.quark.cn/s/27dcad4290ca Silicon Labs(前身为Silicon Laboratories)为其USB至UART转换控制器开发了一款官方驱动程序,即CP210x驱动,该驱动程序在Windows 10操作系统上表现出色。此驱动确保计算机能够识别并有效通信使用配备CP210x芯片的设备,包括开发板、模块或USB转串口适配器。CP2012作为CP210x系列中的一个型号,同样受益于该驱动程序的支持。驱动程序版本v6.7.3代表一个较新的升级,其目标在于解决兼容性挑战,增强性能并提升稳定性。"win10"标签突出了该驱动对Windows 10系统的优化及兼容性,暗示用户在Windows 10环境下可以无障碍地运用CP210x设备。压缩包内含的文件如下: 1. `slabvcp.cat`:作为验证文件,用于核实驱动程序的数字签名,确保驱动源自可信渠道且未被篡改。 2. `CP210xVCPInstaller_x64.exe` 和 `CP210xVCPInstaller_x86.exe`:这两个安装程序分别针对64位和32位的Windows系统设计,用户需依据自身操作系统选择适配版本进行安装。 3. `slabvcp.inf`:作为驱动配置文档,其中包含驱动程序的安装参数,Windows系统将依据此文件进行驱动安装配置。 4. `SLAB_License_Agreement_VCP_Windows.txt`:作为许可文件,用户在安装前须仔细阅读并确认同意其中的条款。 5. `dpinst.xml`:该部署脚本旨在简化驱动安装流程,自动化安装过程以确保驱动正确部署至系统。 6. `x86` 和 `x64...
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值