目录
TG:@yunlaoda360
在2025年云栖大会上,阿里展示了“压箱底”的AI全栈能力,正式发布了从基础大模型到模型架构、专用模型、全模态模型的全系列新模型,实现了全方位的技术突破和全模态覆盖。这些新模型在智能水平、Agent工具调用、深度推理和多模态等方面大幅进步,其中,新一代旗舰模型通义千问Qwen3-Max正式发布,其性能已跻身全球第三,超过GPT-5、Claude Opus 4等顶尖模型。
今天上午,阿里在2025云栖大会上,从基础大模型到模型架构、代码专用模型、视频生成模型、全模态模型,全系列新模型正式发布,实现了全方位的技术突破,覆盖全模态。大会现场展示的新模型在智能水平、Agent工具调用、Coding能力、深度推理、多模态等方面相较以往都有大幅进步。旗舰模型方面,总参数量超过1万亿的通义千问Qwen3-Max正式发布,分为指令(Instruct)和推理(Thinking)两大版本,其性能已跻身全球第三,超过了GPT-5、Claude Opus 4等业内顶尖模型。
旗舰模型与下一代架构
Qwen3-Max在中英文理解、复杂指令遵循、模型工具调用能力和编程能力上实现了突破,大幅减少了大模型幻觉。其在Agent工具调用能力的Tau2 Bench测试中获得74.8分,超过Claude Opus 4和DeepSeek V3.1。推理增强版本Qwen3-Max-Thinking-Heavy在AIME25、HMMT等数学能力评测中获得满分,深度推理能力实现重大突破(国内首次)。此外,通义发布了下一代基础模型架构Qwen3-Next,引入了混合注意力机制、高稀疏度的MoE架构和多Token预测机制等创新,实现了模型计算效率的重大突破:Qwen3-Next模型训练成本较密集模型大降超90%,长文本推理吞吐量提升10倍以上。
Qwen3-Max在SWE-Bench评测中获得了69.6分,位列全球第一梯队;在聚焦Agent工具调用能力的Tau2 Bench测试上,Qwen3-Max取得突破性的74.8分,超过Claude Opus 4和DeepSeek V3.1。推理增强版本Qwen3-Max-Thinking-Heavy可实现结合工具的深度思考,在AIME25、HMMT等数学能力评测中获得满分,是国内首次。 在探索下一代大模型方向上,阿里正式发布了Qwen3-Next及其系列模型。该架构引入了混合注意力机制、高稀疏度的MoE架构以及多Token预测(MTP)机制等核心技术。Qwen3-Next模型总参数为80B,仅激活3B,性能即可媲美千问3旗舰版235B模型,实现了模型计算效率的重大突破,训练成本较密集模型大降超90%,长文本推理吞吐量提升10倍以上。

专用与多模态模型突破
本次发布的模型还覆盖了广泛的专项领域,多项模型填补了开源社区空白:
编程模型Qwen3-Coder: 进行了重磅升级,结合Qwen Code与Claude Code联合训练,具备更强大的代码生成和补全能力,已完全开源,调用量全球领先。
视觉理解模型Qwen3-VL: 迄今为止最强大的视觉语言模型。其核心模型已开源,Instruct版本优于Gemini 2.5 Pro,Thinking版本在多模态推理上达到SOTA。具备「视觉智能体」、「视觉编程」和3D Grounding能力,可自主操作界面并根据草图生成代码,且上下文拓展至百万tokens,支持2小时以上视频理解。
全模态模型Qwen3-Omni: 开源三大版本,在36项音视频领域公开评测中狂揽32项开源最佳性能SOTA,音视频识别、理解、对话能力比肩Gemini 2.5 Pro,并实现了全球首次开源的通用音频Caption模型。
视频生成模型Wan2.5-preview: 首次实现音画同步的视频生成能力,最高支持10秒、24帧/秒、1080P高清视频生成,标志着视频生成迈入「电影级全感官叙事时代」。通义万相累计已生成3.9亿张图像,7000万个视频。
在广泛的专项领域,通义家族取得了多项突破:
编程模型Qwen3-Coder: 进行了重磅升级,结合Qwen Code与Claude Code联合训练,完全开源,具有强大的代码生成和补全能力。
视觉理解模型Qwen3-VL: 是Qwen系列迄今为止最强大的视觉语言模型,核心模型已开源。具备「视觉智能体」、「视觉编程」和3D Grounding能力,能够自主进行电脑和手机界面的操作,生成可执行代码,并将上下文拓展至百万tokens,视频理解时长拓展到2小时以上。
全模态模型Qwen3-Omni: 开源三大版本,在36项音视频领域公开评测中狂揽32项开源最佳性能SOTA,音频识别、理解、对话能力比肩Gemini 2.5 Pro,其中Captioner版本为全球首次开源的通用音频Caption模型,填补了开源社区的空白。
视频生成模型Wan2.5-preview: 首次实现音画同步的视频生成能力,最高支持10秒、24帧/秒、1080P高清视频生成,让视频生成迈入「电影级全感官叙事时代」。

语音大模型与生态布局
通义大模型家族迎来了最新成员——语音大模型通义百聆 Fun,包括语音识别大模型Fun-ASR和语音合成大模型Fun-CosyVoice,覆盖了从客服、销售到直播电商等多个落地场景。至此,通义大模型家族完成了最后一块拼图,覆盖了从0.5B到480B的“全尺寸”和“全模态”。
通义大模型家族迎来了最新成员——语音大模型通义百聆 Fun(Fun-ASR和Fun-CosyVoice),具备强大的上下文理解能力与适用性,可提供上百种预制音色,应用于客服、销售、直播电商等落地场景。 至此,通义大模型家族完成了最后一块拼图,覆盖了从0.5B到480B的“全尺寸”和“全模态”,并全面开源。

战略与未来展望
阿里云公布了通义大模型的最新成绩:已开源300余款通义大模型,全球下载量突破6亿次,衍生模型突破17万个,稳居全球第一,有超过100万家客户接入。阿里巴巴集团CEO吴泳铭表示,AGI并非终点,AI将迈向ASI(超级人工智能)。阿里云将坚定通义千问的开源开放路线,打造“AI时代的安卓系统”,并构建“下一代计算机”的超级AI云,未来三年将投入超过3800亿元用于建设云和AI硬件基础设施,持续升级全栈AI能力。
阿里云公布了通义的一系列最新成绩:截至目前,阿里已开源300余款通义大模型,全球下载量突破6亿次,衍生模型突破17万个,稳居全球第一,有超过100万家客户接入了通义大模型。阿里表示,未来三年将投入超过3800亿元用于建设云和AI硬件基础设施,持续升级全栈AI能力。 阿里巴巴集团CEO吴泳铭表示,AI不会止步于AGI,它将迈向ASI(超级人工智能)。阿里云的战略路径是坚定通义千问的开源开放路线,打造“AI时代的安卓系统”,并构建作为“下一代计算机”的超级AI云。未来,大模型将替代现代操作系统(OS)的地位,成为链接所有真实世界工具的接口。




被折叠的 条评论
为什么被折叠?



