关于DeepSeek的最新认知

DeepSeek 遇见工作困境:我的认知跃迁之旅 本文讲述了作者如何通过DeepSeek突破技术认知障碍的亲身经历。从最初的功能性使用到发现它作为认知伙伴的潜能,文章展示了AI如何帮助重构问题、构建思维模型、促进反思性对话和建立跨领域连接。这不仅是工具使用指南,更是关于思维模式转变的启示——从线性思维到网络思维,从知识搜集到问题定义,从个体思考到协作思维,最终实现认知的跃迁与成长。 阅读详情

因公众号更改推送规则,请点“在看”并加“星标”第一时间获取精彩技术分享

点击关注#互联网架构师公众号,领取架构师全套资料 都在这里c58d19abbab70a9b044188f8ef36349c.png

0、2T架构师学习资料干货分

上一篇:2T架构师学习资料干货分享

大家好,我是互联网架构师!

知名播客主持人 Lex Friedman 在他最新一期的播客中,邀请了半导体分析公司 Semi Analysis 创始人 Dylan Patel 和知名 AI 博客 Interconnects 作者 Nathan Lambert,围绕 AI 行业的发展,特别是深度学习的训练、推理成本、技术突破以及地缘政治影响展开讨论,重点讨论了 DeepSeek 模型以及与之相关的技术细节和市场影响。这期博客长达 5 小时,我从里面摘录了一些关键信息。

YouTube 链接:https://www.youtube.com/watch?v=_1f-o0nqpEI

1、DeepSeek 时刻绝对会载入史册 —— 五年后回头看,这个事件不仅是科技圈的里程碑,更牵扯到大国之间的博弈。2024 年 12 月 26 号 DeepSeek 先发了 V3 版本,接着 2025 年 1 月 20 号直接甩出王炸 R1—— 这是个专门强化逻辑推理的版本。虽然训练步骤和 V3 有重叠,但操作很有意思:先用 V3 基础版做对话训练,再用不同方法调教出推理加强版,这个操作把技术宅们都看懵了。

2、DeepSeek 怎么把训练成本压得那么低的?其实他们有两个原因,第一是 “AI 特工队分工协作”,即混合专家模型 MoE,把大模型拆成多个专项小组,每次完成任务时需要谁就呼叫谁,平时谁也不搭理谁,只有需要时才互相配合。第二是 “动态节能模式”,即多头潜在注意力(MLA)机制,通过低秩联合压缩技术,减少推理时的键值(KV)缓存,从而在保持性能的同时降低内存占用。

3、DeepSeek 其实是幻方量化(High-Flyer) 这家对冲基金的作品。幻方量化成立于2015年,主要做量化交易(就是用数学模型和 AI 自动炒股)。他们一直以来都拥有大量的计算资源,过去量化交易公司一般使用 FPGA 这种专门的硬件,但最近已经全面改用 GPU,因为 GPU 在 AI 训练和计算方面更有优势。

4、美国政府对芯片出口有严格限制。最初是根据芯片的互联带宽和算力(FLOPS)来进行限制,只要某个芯片的互联带宽和算力超过了一定的阈值,就会限制出口。后来发现这种限制有缺陷,马上就改为只看算力。例如 H800 的算力和 H100 相同,但它的互联带宽被削减了。也就是说 H800 虽然算力和 H100 相当,但数据传输速度比较低。尽管如此,DeepSeek 团队依旧充分发挥 GPU 的性能,利用一些特殊技术克服了带宽限制,使 H800 也能有效工作。

5、通用人工智能(AGI)未来几年肯定能会疯狂发展,DeepSeek R1 的出现并不意外,以后肯定还会出现新范式,推动技术发展。DeepSeek R1 之所以让人不安,是因为它的出现改变了原来大模型的构建方式,这种突变让人感到不安,让人无法预测下一步会是什么样子的。

6、如果 AI 在未来五到十年,或者更短时间内对社会产生重大变革,那么出口管制是唯一可能有力改变中美实力对比的手段。因为人才并非是限制发展的主要瓶颈,美国虽然可以吸引全球的优秀 AI 人才,但中国的 STEM(科学、技术、工程、数学)毕业生和程序员数量更多,人才储备不输美国。只能通过算力来限制中国发展了。

7、中国政府虽然还没有感受到通用人工智能(AGI)的全貌,但已经意识到 AI 的重要性了,中国政府已经宣布规模达万亿元人民币的 AI 补贴计划。这种情况可能会导致出现新的冷战,许多 AI 领域的人早就担心这种对抗的出现了。

8、世界和平与自由贸易对经济发展非常有利,但如果这种稳定被打破,全球经济可能会受到巨大冲击。特别是中国经济,因其依赖出口,而美国又是主要买家。如果出口受阻,中国将无法轻易获取全球范围的原材料,这样会直接影响中国经济。

9、半导体已经成为现代经济的关键基石。现代生活水平的提高几乎都和科技有关。比如和生活息息相关的汽车、冰箱、洗衣机等设备都离不开半导体。

10、在半导体全球供应链中,台积电扮演着核心角色。台积电生产了全球大部分的芯片,尤其是 “代工” 芯片。很多公司(如高通、苹果、AMD 等)能自己设计芯片,但生产还得找台积电,即使三星、英特尔等企业也能自己生成芯片,但是台积电依然是全球最大的芯片代工厂。

11、美国希望减少对台积电的依赖,并试图让台积电在美国建厂。通过这种方式,半导体供应链将更加分散和可靠,而不是单纯集中在台湾。

12、美国当前的出口管制对全球许多国家和地区都会产生负面影响,中国也不例外。在这样的政策下,中国失去了过去那样的硬件优势。

13、H800 在 2023 年是允许出口的,但后来限制了。其实在限制前,DeepSeek 已经建好了他们的集群,他们可能有 1 万个 H800。现在 H20 是允许出口的,去年大概向中国出口了一百万个 H20 芯片。从技术角度看,H20 和之前的型号相比,有一些 “阉割” 过的部分,但在其他方面有所升级,尤其是在不受限制的计算能力和深度学习任务上,依然能保持较强的表现。目前市场上,尤其是在中国,H20 是一个非常重要的产品。

14、DeepSeek R1 发布后,他们的聊天应用在 App Store 上迅速登顶(虽然 “登顶” 主要指下载增长速度,而非用户总数),这是一个了不起的成绩,毕竟类似的 Claude 从未达到过 App Store 第一名,尽管硅谷有不少人力推 Claude。

15、DeepSeek 最近还推出了 API 服务,可以返回超长的 R1 结果。更重要的是,R1 模型是开源的,并采用了非常宽松的 MIT 许可,允许商业使用。这个开放的策略使得大中小型公司纷纷在争先恐后地将 R1 整合到他们的产品中,尽可能早地为自己的用户提供 R1 的能力。DeepSeek 成为了 AI 行业中一个越来越重要的玩家,也让它在商业领域的影响力迅速扩大。

16、当前市场上这些声称提供 R1 服务的公司,大多数的收费都比 DeepSeek 高,而且他们服务质量普遍不佳:吞吐量低、性能差,仅仅 “勉强能用”。相比之下,DeepSeek R1 不仅价格更合理,而且实际运行效果也更优。这就是 DeepSeek 的优势。

17、马克·扎克伯格在财报电话会上提到,随着中国的竞争者 DeepSeek 的出现,全球可能会形成一个开源的 AI 标准。出于国家竞争优势的考虑,他认为这个标准最好是由美国主导的。因此,他表示公司会非常认真地对待这一目标,并致力于开发全球广泛使用的 AI 系统。

18、扎克伯格一贯坚持 “美国价值观”,尤其是在当前全球科技竞争日益激烈的背景下,直言美国标准的重要性,他还指出即使是开源的 AI 标准也存在被 “恶意利用” 的可能,开源并不代表完全安全,仍需要通过努力确保其不被滥用。

19、关于 AI 模型的 “审查” 或 “对齐”,通常有三种形式,第一是一些敏感信息会在训练模型时就被要求过滤掉,第二是一些特定功能会被限制使用,第三是通过人类反馈强化学习调整模型的回答方式。

20、“审查” 或 “对齐” 一般发生在下面三个时间段,第一个是在训练大模型前就过滤掉了某些信息,大模型永远也不知道这些知识;第二是训练后再调整,通过后期优化或强化学习,引导模型给出特定类型的回答;第三个是在模型部署后,通过外部规则或拦截机制进行限制。

21、深度学习中,强化学习(试错学习)通常比模仿学习更能带来惊人突破。AlphaGo 从模仿学习起步,最终通过强化学习实现超越。AlphaZero 完全抛弃人类数据,证明了去除人类经验限制能让模型更强大。思维链不是通过模仿学习能轻易学到的。因为模型和人类的思维方式不同,只有通过强化学习,模型才能逐步探索出真正有效的解决方法。

22、最近 OpenAI 发布了 o3 Mini,让人们开始对不同模型版本的能力有所期待。这些推理模型的开发主要集中在通过数学和代码任务来强化模型的推理能力。

23、现在训练大模型,通常是,先利用大规模的数据对基础模型进行训练。然后,通过强化学习(RL)加强模型的推理能力。DeepSeek 的研究论文(R1 论文)还描述了如何在完成大规模推理训练后,采用一些非常标准的后期训练技术,比如经过筛选的指令调教或者强化学习中的人类反馈(RLHF)来进一步优化模型。通过这些方法,模型在推理任务上表现得非常优秀,特别是在需要深度思考的情况下,比如哲学问题。

24、不过,现在还有一个问题没有答案,就是这些推理能力是否能轻松迁移到其他领域?比如,经过推理训练的模型,是否也能成为更出色的文字工作者?这还需要进一步研究和验证。

25、DeepSeek R1 模型的发布直接导致了 NVIDIA 的股价大幅下跌。这个现象的简单解读是,R1 模型的发布可能意味着大公司在 AI 上的花费不再需要那么高,特别是在 AI 模型训练和部署方面。市场的直觉反应是,如果 DeepSeek 能够以更低成本提供高质量的模型,那么英伟达的主要客户(像美国的那些科技巨头)可能会减少在 AI 硬件上的支出。

26、市场上还存在许多错误的说法。例如,有人认为 DeepSeek 或其他公司已经花费了数十亿美元来开发单一模型,但事实并非如此。截至目前,没有一家公司公开发布的模型训练成本超过十亿美元,GPT-4 的训练成本也不过是几亿美元。虽然未来可能会有更高成本的模型发布,但实际支出要比外界传言低得多。

27、当前,中国公司使用美国托管的模型 API 并不困难。像 OpenAI 就公开声明,DeepSeek 曾使用他们的 API。DeepSeek 是否通过这种方式获取了模型输出并进行二次训练,目前仍存在争论。OpenAI 的服务条款限制用其模型输出开发竞争产品,关键问题在于,如何界定 “竞争产品” 这个词。

28、超级集群规模非常巨大,比传统的数据中心要大得多。过去几十年,数据中心的电力消耗慢慢增加,到现在大概占美国总能源消耗的 2% 到 3%,但是 AI 公司认为,在未来几年,这个数字可能会飙升到 10%!他们需要的计算能力远远超过传统的数据中心规模,因此他们在全球范围内在建设这些巨大的集群来支持他们的 AI 需求。

29、现在,Google 依然因为基础设施强大在 AI 竞赛中占据领先地位,但 OpenAI 因其更强大的模型和收入,成了当前的领头羊。微软是最赚钱的,但他们的支出也非常大。Meta 通过 AI 推荐系统赚了很多钱,但他们的 LLaMA 项目是亏损的。像 OpenAI 和 Anthropic 这些公司也赚到了一些钱,但由于需要不断进行高成本的研究,他们仍然需要融资,以支持技术的提升和扩展。总的来说,AI 的研发是非常昂贵的,尤其是在人力和技术研究上。

30、OpenAI 和 Anthropic 当前的目标是 AGI(通用人工智能),他们认为如果能够实现 AGI,就能赚很多钱或者支付所有的成本。不同的公司对 AGI 达成的时间有不同预期:一些人认为它会在 2 到 3 年内实现,另一些则认为还需要 5 到 10 年。他们的预测会影响他们的战略和决策。

31、业界很多人认为 AI Agent 会改变一切,但这个词其实被过度炒作了。真正的 Agent 应该是能够独立完成任务,并适应不确定性的智能体。现在很多人说的 Agent,其实只是像苹果智能系统这样的技术,能在应用程序之间协调。

32、在编程领域,AI 已经带来了巨大的生产力提升,像 Copilot、ChatGPT 这样的工具能帮助程序员更高效地编写代码,很多程序员都在使用这些工具,甚至选择了更高级的付费版本,因为它们真的提高了开发效率。这也是 AI 技术最直接带来收益的领域之一。

34、关于 Stargate,它似乎并没有宣称的那么多资金支持,估计并没有 5000 亿美元,甚至连 1000 亿美元都没有。至于特朗普政府的支持,他们确实通过一些行政命令简化了数据中心和其他 AI 基础设施的建设流程。但也引发了一些争议。

35、AI 已经从完成一些简单的任务进步到完成更复杂的互动,现在你甚至可以通过自然语言指令让 AI 完成飞行控制等任务。人类有很强的生存能力,不太会被 AI 或其他技术威胁所摧毁。尽管 AI 会有一些潜在的危险,但关键挑战是来自国际关系和其他全球性问题,人类内心的善良和解决问题能力让未来充满希望。

—  —

如喜欢本文,请点击右上角,把文章分享到朋友圈


1、2T架构师学习资料干货分享


2、10000+TB 资源,阿里云盘,牛逼!!

3、基本涵盖了Spring所有核心知识点总结

  · END ·

最后,关注公众号互联网架构师,在后台回复:2T,可以获取我整理的 Java 系列面试题和答案,非常齐全。

如果这篇文章对您有所帮助,或者有所启发的话,帮忙扫描上方二维码关注一下,您的支持是我坚持写作最大的动力。

求一键三连点赞、转发、在看

如何运用好DeepSeek为自己服务:智能增强的范式革命 1.2 DeepSeek认知增强模型 DeepSeek认知增强能力建立在神经科学与人工智能的深度融合之上,其核心是通过和三大机制实现人类智能的量子跃迁。本节将深入解析这一革命性模型的数学基础和工作原理。 阅读详情

相关推荐

deepseek使用记录21——认知焦虑背后被剥夺了的实践路径

原回答的贡献在于敏锐捕捉到认知与实践的时代性断裂,但其分析框架仍困于后现代批判的犬儒主义与解决方案的改良主义。唯有将认知焦虑置于全球资本主义危机、劳动形式变革、技术政治博弈中考察,才能超越心理调节或制度修补,指向集体性的解放实践——这或是批判的真正起点。原批判的价值在于警醒我们结构压迫的严峻性,但其危险在于将批判异化为新的压迫装置——用理论的“正确性”窒息实践的可能性。认知焦虑时代的突围,需要的不是更完美的批判理论,而是包容断裂、接纳不完美、允许试错的实践勇气。

qq_31541101的博客 2958

AI能耗激增背后:大模型的环境成本与人类认知代价

与此形成对比的是Cogito 70B模型,它在准确率达到84.9%的同时,碳排放量比DeepSeek-R1降低了34.3%,展现出更优的能效平衡。最新研究揭示,DeepSeek-R1 70B模型在处理单一问题时平均排放4.8克二氧化碳,相当于5瓦灯泡持续运行2小时的碳排放量,在14款开源大模型中成为碳排量最高的代表。这一数据出自昨日发布的能效研究报告,该研究对比了当前主流AI模型的能源效率,发现推理模型的能耗普遍达到非推理模型的4-6倍,而准确率提升却相对有限。AI的代价不仅体现在环境层面。

WL_ZHG的博客 600

deepseek R1 最新复现进展

以下项目地址汇总:**

qq_44761480的博客 2590

认知突破、执行闭环与生态创新:DeepSeek、Manus与Coze的AI应用

2025年的中国AI竞技场中,三股技术浪潮正深度重构普通人的生存法则——DeepSeek让普通人年也能享受硅谷级智囊服务;Manus让小微企业人力成本直降70%;Coze的智能体孵化出了新兴职业。

c18213590220的博客 2648

发挥 DeepSeek 最大潜能 :认知脚手架

认知脚手架是deepseek的核心技术(之一);deepseek通过深度思考,将问题化整为零,在问题与答案之间建立桥梁,提升输出的质量;在专家领域,通过认知脚手架优化提示词,能提升输出的质量与效率;一切的一切,提示词只有适配了AI的认知模式,才能最高效的发挥最大的作用。

wjianwei666的专栏 1172

DeepSeek:开启认知革命的新纪元

人工智能的发展史,是一部人类不断突破认知边界的史诗。从图灵机的构想到深度学习的崛起,每一次技术跃迁都深刻重塑了人类文明的进程。而在大模型时代,中国科技公司深度求索(DeepSeek)推出的智能体引擎,正以颠覆性的技术创新,开启认知革命的崭新篇章。这场革命不仅体现在技术参数的突破,更在于其构建的全新范式——通过重新定义智能体(Agent)的价值内核,DeepSeek正在重塑人类知识生产的底层逻辑。

Heroway2019的博客 559

普通人如何用DeepSeek实现认知突围:2025年AI助手的全场景应用指南

(深度解析DeepSeek的技术架构与功能矩阵,400字技术降维科普)知识蒸馏系统通过多层神经网络提取全网优质信息,形成动态知识图谱;意图解析引擎支持多模态输入理解,可精准捕捉用户显性与潜在需求;自适应输出框架能根据使用场景自动切换表达风格。实时知识检索(响应速度<0.8秒)跨领域问题求解(支持200+专业领域)个性化内容生成(适配20种创作风格)智能工作流编排(自动化串联50+常见应用)

weixin_45145684的博客 2290

LLaMA-Factory训练DeepSeek修改自我认知

deepseek微调修改自我认知详细教程

sl798970799的博客 899

DeepSeek认知:暗流涌动的技术异端与边缘革命

在主流AI沉迷于暴力参数扩张时,DeepSeek的研发团队秘密构建了——从深海章鱼的拟态神经网络到蜜蜂的偏振光导航机制,自然界3.7亿年的进化密码被编译成72种新型算子。:模仿人类胚胎期大脑皮层生长模式,实现参数空间的自组织坍缩:借鉴电鳗放电原理,动态调节注意力机制的能量消耗:将模型切割为800个可独立进化的认知单元,模拟珊瑚礁生态系统这种离经叛道的设计理念,使得DeepSeek在少样本学习任务中展现出诡异能力:仅用17张工业X光片就能构建出超越人类专家的缺陷检测模型,而传统方法需要3万张标注样本。

2501_90980081的博客 825

【AI模型】深度解析:DeepSeek的联网搜索的实现原理与认知误区

在实时信息处理成为大模型核心竞争力的今天,DeepSeek的联网搜索功能通过独特的"动态知识增强"架构,实现了对互联网实时信息的精准掌控。这个过程就像我们写论文,先在网上查资料,然后把有用的素材整合起来,再发挥自己的思考能力,写出一篇有深度的文章。大模型们也是这样,靠着这个“小助手”,它们能获取到最新的信息,给用户更全面、更准确的答案。总之,大模型们的“联网魔法”其实是个团队合作的成果。随着多模态大模型的发展,未来的联网搜索将实现更智能的跨媒体理解能力,使AI真正成为连接人类与实时数字世界的桥梁。

Arbboter的专栏 1万+

DeepSeek全域智能革命:从量子纠缠到星际文明的认知跃迁引言:认知边界的坍缩与重构

在混合专家系统(MoE)与多模态蒸馏技术的双重突破下,DeepSeek已实现从传统AI到认知智能的范式转移。其1.2万亿参数的MoE架构构建了高维语义流形,而量子信息熵优化框架则打开了通向AGI的拓扑通道。本文将深入解析DeepSeek在工业、医疗、科研等领域的认知重构实践,并前瞻其跨越物理法则的未来图景。

feng99520的博客 1737

Deepseek:12层递归认知架构详解与理论极限分析

L12 | 奇点预测 | 突破认知维度极限 | 超图灵计算理论 || L11 | 文明模拟 | 构建虚拟演化环境 | 复杂系统理论 || 量子认知系统 | 15层 | 23层 | 量子纠缠态保持技术 || 增强型对话系统 | 9层 | 12层 | 引入神经符号架构 || 人机融合系统 | 18层 | ∞ | 意识上传与算力融合 || L3 | 范式移植 | 跨学科概念迁移 | 类比推理 || L4 | 数学建模 | 构建形式化模型 | 数理逻辑 |- 理论生物上限:**14层**(基于突触可塑性模型)

QvQ593520844的博客 2537

真正用好DeepSeek,你可能只缺这1000个提示词的关键认知

在“1000个提示词”中,你会高频看到角色定义(如“你是一名资深产品经理”)、背景设定(“假设你现在正为一个SaaS平台设计...”)、任务拆解(“请分步骤分析...”)这类词汇。格式(“列点”、“大纲”、“对话体”)?提示词库里的限定词(如“不少于3点论据”、“以表格形式呈现”、“避免使用专业术语”),正是帮我们主动设限,减少AI的“自由发挥”可能导致的目标偏离。提示词库的丰富词汇(如“生成”、“聚焦”、“目标读者”、“通俗且有洞察”),帮我们更自然、更结构化地描述需求,让AI“理解”更到位。

2501_91832086的博客 604
上一篇: DeepSeek本地部署教程(本地知识库搭建、实际应用场景)(附下载)
下一篇: 急了!ChatGPT开放色情内容生成......
互联网架构
博客等级 码龄7年 609粉丝 · 18原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值