阿里云的通义团队(Qwen team, Alibaba Cloud)今天正式向全球发布了他们最新、最强大的大型语言模型系列——Qwen3。作为Qwen家族的最新一代成员,它的混合思考模式、强大的推理和多语言能力,以及在智能体方面的优化,代表了阿里迄今为止最先进、最智能的系统。是阿里在AI领域又一次重大进步。


1、Qwen3模型简介
Qwen3是由阿里云通义团队(Qwen team, Alibaba Cloud)开发的大型语言模型系列。它是继Qwen2.5之后的最新一代模型,汲取了团队在构建QwQ(思维模式)和Qwen2.5的经验。这次发布包含了多种不同规模的模型,并且对模型的权重进行了公开,遵循 Apache 2.0 开源许可协议。这意味着更多开发者和研究人员可以免费使用和研究这些前沿的模型。
2、Qwen3模型的亮点
Qwen3带来了多项关键性的提升:
2.1、 核心特点:
1)创新的混合推理模型: 它将“快思考”和“慢思考”两种模式集成于一体。对于简单问题,模型能够以低算力快速响应(非思考模式:用于高效的通用聊天);而对于复杂的、需要深入分析的问题,模型则会进行多步骤的“深度思考”(思考模式:用于复杂的逻辑推理、数学和编码),从而在速度和深度之间取得平衡,并显著节省算力消耗。用户可以根据实际需求设置“思考预算”,灵活控制模型的推理程度。
2)显著增强的推理能力: 超越之前的 QwQ(思维模式)和 Qwen2.5 指导模型(非思考模式),在数学、代码生成和常识逻辑推理等领域的表现大幅提升。
3)卓越的人类偏好对齐 , 在创意写作、角色扮演、多轮对话和遵循指令方面提供更自然、引人入胜的体验。
4)强大的智能体(Agent)能力: 拥有丰富的专业知识,Qwen3原生支持模型上下文协议(MCP),并具备强大的工具调用(Function Calling)能力。结合Qwen-Agent框架,可以更高效地完成复杂的基于代理的任务,降低了Agent开发的门槛。
5)广泛的多语言支持: 支持超过100种语言和方言,具备强大的多语言指令遵循和翻译能力。
6)丰富的模型版本并全面开源: Qwen3系列提供了多种参数规模的模型,包括0.6B、1.7B、4B、8B、14B、32B等密集模型,以及30B和235B的MoE模型。更重要的是,包括旗舰模型在内的所有Qwen3模型都已开源,开发者可以在魔搭社区和Hugging Face等平台免费下载使用。
2.2、 技术亮点:
1)混合专家(MoE)架构:部分Qwen3模型采用了MoE架构,可以在保持高性能的同时,显著降低激活参数量,提高计算效率。
2)四阶段训练流程:为了开发具备思考推理和快速响应能力的混合模型,Qwen3采用了包括长思维链冷启动、长思维链强化学习、思维模式融合和通用强化学习在内的四阶段训练流程。

3)海量训练数据: Qwen3的预训练数据量达到了36T,并在后训练阶段进行了多轮强化学习,以优化模型的性能和对齐。
3、Qwen3核心能力解读
让我们更深入地看看Qwen3的几个核心能力:
1)混合“思考”模式(Hybrid Thinking Modes): 这是Qwen3的一大创新。
-
在“思考模式”下,模型会像人类一样,提供最终答案之前需要时间逐步推理(类似链式思考 CoT),然后给出最终答案。这对于需要深度分析和逻辑推理的复杂问题(比如数学、编程)特别有用。
-
在“非思考模式”下,模型则会快速直接给出响应,适合那些对速度要求更高的简单任务。
这种模式允许用户根据任务的难度和需求来控制模型“思考”的程度,从而在效率和答案质量之间找到最佳平衡在对话中,用户甚至可以通过/think或/nothink指令来动态切换模式。
至关重要的是,这两种模式的融合极大地增强了模型实施稳定高效的思维预算控制的能力。如上所述,Qwen3 表现出可扩展且流畅的性能改进,这与分配的计算推理预算直接相关。这种设计使用户能够更轻松地配置特定于任务的预算,从而在成本效率和推理质量之间实现更理想的平衡。

2)推理能力的飞跃: Qwen3在推理能力上有了显著提升。这得益于训练数据量的翻倍(从Qwen2.5的18万亿tokens增加到Qwen3的约36万亿tokens),并且增加了更多知识密集型数据,如STEM、编程和推理任务。同时,在后训练阶段使用了多样化的长链式思考(CoT)数据来增强模型的基础推理能力。

3)超广泛的语言支持: Qwen3支持119种语言和方言,涵盖了全球多种语言体系。这让Qwen3能够更好地服务于全球用户,在多语言环境下的指令遵循和翻译表现出色。

4)强大的智能体能力: Qwen3优化了代码生成和智能体能力,还加强了对 MCP 的支持,能够准确地集成外部工具。官方甚至推荐使用Qwen-Agent这个工具库来充分发挥Qwen3的智能体能力,它封装了工具调用模板和解析器,大大降低了开发复杂度。





4、Qwen3的基准测试结果
在多项基准测试中,Qwen3展现了与其先进性相符的性能。
旗舰模型Qwen3-235B-A22B在编程、数学和通用能力等测试中,与DeepSeek-R1、Grok-3等顶尖模型相比,展现了竞争力。Qwen3较小的密集模型(如4B)就能达到与Qwen2.5更大模型(如72B-Instruct)相当的性能。


在STEM、编程和推理等关键领域,Qwen3的密集基础模型普遍超越了参数量更大的Qwen2.5基础模型。
而新引入的MoE模型,在仅使用少部分激活参数(约10%)的情况下,就能达到与Qwen2.5密集基础模型相似的性能,这显著节省了训练和推理成本。
5、应用前景:
Qwen3的发布和开源,有望为AI应用和智能体(Agent)的爆发提供更强大的基础模型支持,降低开发成本,并推动大模型在更广泛的场景中落地应用,例如智能助手、代码生成、内容创作、多语言交流等。个人用户可以通过通义App直接体验Qwen3,夸克等应用也将很快接入。
6、如何快速体验Qwen3
想要亲自感受Qwen3的强大?有很多方式!

1)对于普通用户: 最简单直接的方式是访问Qwen Chat网站(chat.qwen.ai)或使用其移动APP。
2)对于开发者和技术爱好者:
-
你可以在 Hugging Face、ModelScope 或 Kaggle 等平台上找到并下载Qwen3模型。模型权重已公开并在 Apache 2.0 许可下发布。
-
可以使用 Transformers 库进行推理。
-
或者利用 llama.cpp、Ollama、LMStudio、MLX 等工具在本地设备上运行模型。
-
对于大规模推理部署,可以考虑使用 SGLang 或 vLLM 等框架搭建兼容 OpenAI API 的服务。
7、Qwen3的未来展望
Qwen团队表示,Qwen3的发布是他们迈向通用人工智能(AGI)乃至超级人工智能(ASI)征程中的一个重要里程碑。通过进一步扩大预训练和强化学习(RL)的规模,模型实现了更高水平的智能。
展望未来,团队将继续在多个维度进行深入探索和提升:
1)优化模型架构和训练方法。
2)持续扩展数据量和模型规模。
3)延长上下文长度。
4)增强多模态能力。
5)利用环境反馈推进长周期推理能力。
团队认为,我们正从一个专注于训练模型的时代,过渡到一个以训练智能体(Agent)为中心的时代。未来的迭代有望为每个人的工作和生活带来更具意义的进步。
结语
阿里巴巴发布的Qwen3系列大型语言模型,无论在模型能力、使用灵活性还是开源开放方面,都代表了阿里在****AI领域又一次重大进步。它的混合思考模式、强大的推理和多语言能力,以及在智能体方面的优化,都为我们描绘了一个更加智能、更加易用的AI未来。
大模型岗位需求
大模型时代,企业对人才的需求变了,AIGC相关岗位人才难求,薪资持续走高,AI运营薪资平均值约18457元,AI工程师薪资平均值约37336元,大模型算法薪资平均值约39607元。

掌握大模型技术你还能拥有更多可能性:
• 成为一名全栈大模型工程师,包括Prompt,LangChain,LoRA等技术开发、运营、产品等方向全栈工程;
• 能够拥有模型二次训练和微调能力,带领大家完成智能对话、文生图等热门应用;
• 薪资上浮10%-20%,覆盖更多高薪岗位,这是一个高需求、高待遇的热门方向和领域;
• 更优质的项目可以为未来创新创业提供基石。
可能大家都想学习AI大模型技术,也想通过这项技能真正达到升职加薪,就业或是副业的目的,但是不知道该如何开始学习,因为网上的资料太多太杂乱了,如果不能系统的学习就相当于是白学。为了让大家少走弯路,少碰壁,这里我直接把全套AI技术和大模型入门资料、操作变现玩法都打包整理好,希望能够真正帮助到大家。
读者福利:如果大家对大模型感兴趣,这套大模型学习资料一定对你有用
零基础入门AI大模型
今天贴心为大家准备好了一系列AI大模型资源,包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。
有需要的小伙伴,可以点击下方链接免费领取【保证100%免费】
1.学习路线图




如果大家想领取完整的学习路线及大模型学习资料包,可以扫下方二维码获取

👉2.大模型配套视频👈
很多朋友都不喜欢晦涩的文字,我也为大家准备了视频教程,每个章节都是当前板块的精华浓缩。(篇幅有限,仅展示部分)

大模型教程
👉3.大模型经典学习电子书👈
随着人工智能技术的飞速发展,AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型,如GPT-3、BERT、XLNet等,以其强大的语言理解和生成能力,正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。(篇幅有限,仅展示部分,公众号内领取)

电子书
👉4.大模型面试题&答案👈
截至目前大模型已经超过200个,在大模型纵横的时代,不仅大模型技术越来越卷,就连大模型相关的岗位和面试也开始越来越卷了。为了让大家更容易上车大模型算法赛道,我总结了大模型常考的面试题。(篇幅有限,仅展示部分,公众号内领取)

大模型面试
**因篇幅有限,仅展示部分资料,**有需要的小伙伴,可以点击下方链接免费领取【保证100%免费】
**或扫描下方二维码领取 **


2880

被折叠的 条评论
为什么被折叠?



