2025 年 5 月 30 日消息,DeepSeek R1 于 2025 年 5 月 28 日推出最新版本 DeepSeek-R1-0528。尽管官方将其称为 “小版本试升级”,但实际测试显示,该版本在推理深度、编程能力、抗幻觉等方面实现了大幅提升,性能接近 OpenAI o3 和 Gemini-2.5 Pro 等国际顶尖模型。以下是本次升级的核心内容以及为各领域带来的提升。
一、核心升级内容
-
推理能力显著强化
在数学、编程、逻辑类任务中,DeepSeek-R1-0528 的表现有了质的飞跃。以 AIME 2025 数学竞赛题为例,其准确率从旧版的 70% 提升至 87.5%。同时,模型在解题过程中 token 使用量近乎翻倍,平均每题从 12K tokens 增加到 23K tokens,这表明模型能够进行更深入、更细致的多步骤思考。此外,它还支持单任务持续推理 30-60 分钟,非常适合解决复杂问题。 -
编程能力实现爆发式增长
该模型在代码生成、调试以及多语言项目开发(包括 Python、JS、TS、Rust 等)方面的表现接近 OpenAI o3。它不再局限于生成代码片段,而是能够直接生成完整的项目,如贪吃蛇游戏、前端网页应用等。在 HumanEval、MBPP 等编程基准测试中,其成绩接近甚至部分超越 o3,尤其在游戏开发(物理引擎、碰撞检测等)和前端框架(React/Vue)项目中表现出色。 -
幻觉率大幅降低
在摘要生成、改写润色、阅读理解等场景中,DeepSeek-R1-0528 的错误率大幅下降,幻觉率降低了 45%~50%,输出内容更加可靠。 -
创意写作与长文生成能力优化
对于议论文、小说、散文等文体,模型生成的内容结构更加完整,篇幅更长,文风也更符合人类的阅读偏好。 -
支持工具调用
模型支持外部工具集成,例如调用 API 或插件,在 Tau-Bench 测试中,其表现达到了 OpenAI o1-high 水平(Airline 53.5%、Retail 63.9%)。 -
API 与工程优化
API 支持 JSON 输出和函数调用,max_tokens 上限提升至 64K(包含思考过程)。网页端和 App 仍支持 64K 上下文,而开源版则支持 128K 长上下文。
二、多场景应用提升
| 应用场景 | 能力提升点 | 适用用户 / 行业 |
|---|---|---|
| 数学题逐步推理解题 | AIME 准确率达 87.5% | 教育 / 科研领域的学生、教师、学术研究者 |
| 论文辅助写作、摘要可靠生成 | 内容更准确、结构更清晰 | 科研人员、写作者 |
| 编程开发 | 一键生成完整项目,跨语言开发与调试能力增强 | 开发者、游戏工作室、全栈工程师 |
| 内容创作 | 长篇小说 / 议论文结构优化,幻觉率降低,改写更准确 | 作家、编辑、自媒体从业者、市场文案人员 |
| 工具调用 | 支持外部系统集成 | 企业工具集开发人员,金融、医疗、RAG 系统开发领域从业者 |
| 日常效率工具 | 长文档总结(128K 上下文),角色扮演、生活助理更自然,响应速度优化(延迟降低 10-20%) | 普通用户、办公人士、知识工作者 |
三、技术亮点与生态支持
- 开源免费:模型权重(685B 参数)继续采用 MIT 协议开源,支持私有部署与蒸馏训练,降低了使用成本。
- 小模型能力突出:蒸馏出的 DeepSeek-R1-0528-Qwen3-8B 模型在 AIME 测试中媲美 235B 大模型,适合在边缘设备部署。
- 国产模型的突破:在编程、数学推理等硬核任务上接近 o3/Claude 4 Opus,中文能力尤其领先。
四、适用人群
如果你从事编程、数学研究、长文写作、企业自动化工具开发,或者希望用开源免费模型替代高价闭源服务(如 GPT-4o/Claude 3.5),DeepSeek-R1-0528 将为你带来显著的效率提升。普通用户也能在内容总结、学习辅助、创意生成等方面获得更流畅、可靠的体验。
目前,可通过 DeepSeek 官网、App 或小程序开启 “深度思考” 模式,立即体验新版 R1 的强大功能。
如果你正在为多模型接入、算力调度和开发成本头疼,DMXAPI 正是你需要的解决方案!作为聚合全球主流大模型的智能API平台,DMXAPI以“降本增效”为核心,为开发者提供一站式AI集成服务,助你轻松跨越技术门槛。
1个API Key调用全球主流模型(GPT/Claude/Gemini/Llama等)
统一接入标准,无需为不同平台重复开发接口
智能路由系统自动选择最优服务节点

7783

被折叠的 条评论
为什么被折叠?



