LLM逻辑推演策略选择:推理时计算 vs 训练时计算

74c909fd89851f475cacc6c3a023d951.png

AGI实现的一大标志是,具备人类级别的逻辑推理(reasoning)能力。近期,随着推理(inference)模型GPT o1、DeepSeek R1-Lite的发布,模型的逻辑推理能力得到显著提升,也预示着对LLM潜力的深度挖掘正在转向推理阶段。

围绕增强LLM逻辑推理能力这一目标,美国人工智能与密码学研究实验室Bagel团队结合最新研究,从算术、常识和符号这三种主要逻辑推理类型出发,对比了在推理时计算与训练时计算这两种策略下增强LLM逻辑推理能力的优劣。结果显示,推理时计算是更好的技术选择。

(本文由OneFlow编译发布,转载请联系授权。原文:https://blog.bagel.net/p/train-fast-but-think-slow)


作者 | Bagel Team

OneFlow编译

翻译|张雪聃、林心宇、刘乾裕
题图由SiliconCloud平台生成

AI好似火焰。

近年来,我们在技术上取得了突破性进展。比如社交媒体、增强现实、平台转换如Web、移动设备等,不过,AI是一项更为重要的技术,它的意义堪比火种的发现,它有潜力改变我们物种进化的轨迹。

解锁AI潜力的“圣杯”之一就是构建能够像人类一样逻辑推理的系统。通过提升AI,尤其是大语言模型(LLM),可以分析复杂问题并应用逻辑步骤的能力。

Bagel的研究团队一直在探索这个问题。我们分析了LLM的构建技术,特别是微调技术,旨在让LLM从模式识别预测智能体发展成为真正的认知智能体。我们的深入研究涵盖了三种主要的逻辑推理类型,也就是智能:算术、常识和符号

现在,我们想和大家分享研究成果。该研究针对的是我们认为AI进化最终目标的核心问题——人类级逻辑推理,甚至超越人类级逻辑推理(神级推理?)。

我们探索了模型开发中训练和微调阶段的技术,也探索了推理时阶段的逻辑推理,在这个阶段,LLM可以在推理过程中生成新的解决方案,即使这些解决方案并不包含在它们的训练数据集中。

1

逻辑推理类型

各种逻辑推理任务拓展了AI的能力。首先,让我们了解一下它们的定义。

算术逻辑推理促使机器学习以明确的方式测试问题解决能力。它迫使模型分解问题,选择多种策略,从而连接步骤以找到解决方案。这使得数学逻辑推理与其他不同。它清晰地展示了模型能在多大程度上掌握细节,并按正确的步骤使用解决方案。

常识逻辑推理颠覆了我们的预期。模型必须理解人们日常生活中奇怪的逻辑。当系统面对人类互动的怪癖时,挑战就出现了。我们理所当然的隐性规则,如门在你走进之前会打开;时间是向前流动的而非倒流的;水让物体变湿,这些显而易见的真理变成了AI系统必须解开的复杂难题。

符号逻辑推理打破了传统机器学习的模式。虽然神经网络在模糊模式匹配上表现出色,但符号要求精确。模型必须遵循严格的规则,操控抽象概念,链式逻辑推理。像一个严谨的数学家,而不是一个直觉艺术家。符号本身没有固有意义,但通过它们,我们建立起指向人类级逻辑推理的逻辑塔。

除了这些核心类型,逻辑推理还有多种形式。逻辑推理得出严格的结论,而归纳推理则进行创造性的跳跃。因果逻辑推理追踪行动与后果之间隐藏的线索。多模态逻辑推理在文本、图像和数据的复杂组合中进行理解。知识图谱则映射事实与关系之间的联系。然而,所有这些逻辑推理形式都服务于一个目标——将AI从模式匹配推动到真正的理解。从记忆的回应到新颖的见解,从预测到理解。

接下来,我们将探讨训练时间(training-time)和推理时间(Inference-time),以增强这些推理类型的能力。

1. 训练时间的策略

1.1 微调方法

  • 参数高效微调(PEFT)

工作原理:PEFT颠覆了传统的模型适应方法(https://arxiv.org/abs/2304.01933)。通过四种方法揭示了新的技术。

基于提示的学习将可调信号嵌入到冻结(frozen)的模型中。前缀微调(Prefix-tuning)和P微调(P-tuning)引入了微小的变化。这些变化不会改变主体模型,但会改变输出结果。

重参数化方法,如LoRA简化复杂的权重矩阵将大规模更新转化为高效的低秩形式。LoRA通过最小的调整从高维空间中捕捉模式。

适配器创建额外的神经通路。串行适配器层层叠加,每一层逐步调整输出。并行适配器发展侧面技能,保持基础模型不变。

适配器的位置至关重要。串行适配器位于MLP层后面,并行适配器则在这些层内表现更好。LoRA涉及注意力层和MLP层。每种方法都瞄准正确的位置。

ee10b7d094b9b3b5466ef0607fccc853.png

实用价值:PEFT减少了资源需求。大模型可以在不做重大改动的情况下获得新能力。PEFT在保留基础模型的同时增加了专业技能。原本在微调方面受限的硬件现在能够处理复杂的更新。

权衡取舍:并非所有任务都适合PEFT。有些模型需要更深入的变化,基础模型的限制仍然存在。结合不同方法可能会很复杂。PEFT在处理非常复杂的任务时可能会遇到困难。

  • WizardMath

工作原理:WizardMath通过三个不同的步骤进行学习(https://arxiv.org/abs/2308.09583)。

首先是监督微调。在这一阶段,模型开始捕捉数学模式,识别基本结构,模式被映射到解决方案上。这一过程为常见操作建立直觉,奠定基础。

接下来,指令奖励模型细化了这一过程。这些模型评判答案和方法的效率,引导模型向优质的解决方案迈进,重点从正确性转向质量。

最后,基于PPO的强化学习增强了问题解决能力。模型测试不同的想法,进行适应和改进。Evol-Instruct反馈循环在每次运行时优化其逻辑(https://arxiv.org/abs/2304.12244)。WizardMath模型变得更擅长选择策略。

5c4041b57a3a773777161afd0cdbea3e.png

实用价值:大多数模型只是匹配模式,而WizardMath则按逻辑步骤思考。它像数学家一样分解问题,根据理解而非记忆选择方法。这能带来有效精准的解决方案。

权衡取舍:训练WizardMath需要大量的计算资源,专注于深度数学限制了它的通用性。低质量数据可能会引发错误,实用性方案有时会被更加简洁巧妙的解决方案替代。

  • 发散思维链(DCoT)

工作原理:DCoT打破了单一路径的处理方式(https://arxiv.org/abs/2407.03181),同时形成多条路径,每条路径以不同的方式解决问题,最终汇聚到一个推理结论上。

7f1cee16f222ba316bb86762fd69f555.png

零样本生成可以带来多样化的解决方案。每条路径都追求真相,各自沿着自己的方式前进。有些路径直接明了,有些则更复杂,但都有效。模型的表现就像一个专家小组,每条路径提供不同的视角。

这些路径之间会相互作用,强大的策略会合并,弱点则会暴露。模型学会评估自己的推理,比较方法,融合见解,而这一切无需额外的训练。

实用价值:多条路径提供内置的验证。当路径一致时,结果的可信度提高;当路径不一致时,问题也随之浮现。不同的视角揭示隐藏细节,多样性加深理解。

权衡取舍:更多路径意味着更高的计算需求,平衡多样性和一致性也充满挑战。冲突路径需要解决,对于简单任务来说,这种方法可能有些过度。多个路径不总是优于单一路径。

1.2. 预训练和知识迁移

  • 持续预训练

工作原理:像Galactica(https://arxiv.org/abs/2211.09085) 和MINERVA(https://arxiv.org/abs/2206.14858)这样的模型不仅限于标准训练。它们从超过1000亿个科学数据的词元中学习,包括数学论文、科学文章和技术文档。原始数据被转换成结构化知识。

Galactica包括特定科学术语的词元,将引文视为词汇的一部分,使化学公式具有意义,并将数学符号视作工具,学习科学的语言。

MINERVA专注于定量逻辑推理,回答物理、化学和经济学中的自然语言问题,将问题转换为数学公式,使用LaTeX展示详细解答,并独立进行计算。

7d02d8233e3056337bdee45b0492eb43.jpeg

实用价值:在特定领域中,小型模型能超过大型模型。它们掌握复杂的数学,自然地处理技术符号。通用模型与专家之间的差距缩小。

权衡取舍:训练成本上升,每个领域都需要大量新数据。随着新知识的积累,旧知识可能逐渐被淡忘。在某一领域的深入专注与多领域通用性之间找到平衡很难;模型可能在物理学上表现出色,但在其他领域相对较弱。

  • 课程学习

工作原理:学习从随机采样转变为结构化进阶(https://aclanthology.org/2022.naacl-main.72/)。类似进化过程,但有指导、目的明确。

教师网络对训练样本进行排序,先易后难。复杂概念在简单概念的基础上建立,步调函数(pacing function)控制知识流动,有时固定,有时自适应,以响应模型的理解能力。

79f8b743a927592657bb3401b5961ff4.png

有三种方法可以评估样本难度:问题回答概率追踪模型的成功率;模型可变性观察一致性;基于能量的评分识别异常情况和边缘案例。课程会根据这些信号进行调整。

实用价值:模型学习效率更高,先夯实基础,再逐步应对复杂内容。概念理解在过程中自然增长,每个概念都强化了前一个概念,按顺序学习让复杂概念变得更易理解。

权衡取舍:即便是专家,设计出有效的课程也是一项挑战。这会延长学习时间,而且有些概念难以按顺序安排。从简单到复杂的路径并不总是清晰明了,有时无序反而比有序更具启发性。

  • 思维链知识蒸馏

工作原理:大模型成为教师,小模型成为学生,知识通过精心挑选的示例传递(https://arxiv.org/abs/2212.08410)。

过程分为两步。首先生成思维链数据,大模型逐步解决问题,展示其思考过程,形成逻辑推理路线,只有正确的解答才会被采纳,毕竟质量比数量更重要。

接着是学生微调,小模型从这些示例中学习,不仅看答案,还看思考过程。目标答案引导初步步骤,防止小错误导致整体解答偏离轨道。教师引导(强制)机制确保学生模型沿着正确的方向学习。

994f8472c9f9e8470d55dbedb1b5262a.png

实用价值:小型模型也能够进行高级逻辑推理了,复杂问题的解决技能能高效地传递给它们。小型模型可以在资源有限的情况下学会清晰思考,无需承担计算负担就能获得大型模型的智慧。

权衡取舍:在信息传递过程中,部分复杂性会有所丢失。学生模型的能力终究无法与教师模型完全匹配。知识蒸馏过程需要精心把控,因为不良示例可能会导致模型养成不良习惯。在信息压缩与理解之间保持平衡是一件极为微妙的事情。

2. 推理时间的策略

2.1. 基于链式的方法

  • 思维链(CoT)

工作原理:Wei等人(https://arxiv.org/abs/2201.11903)在2022年的论文中重新定义了逻辑推理过程,仅用八个示例就引导语言模型逐步解决问题,激活了模型的潜在能力。

70fc21e56d90177ed133665c24ee92a9.png

通过精准的提示,模型能够展现出其内部逻辑推理过程。在此过程中,无需对模型开展新的训练或进行变更,只需运用一些具有策略性的示例,就可以挖掘出模型的这种潜在能力。

模型学着将问题分解成类似人类思维的逻辑步骤,使每一步都清晰明了,从而让其内部的思考过程从一个“黑箱”状态转变成一个可见的步骤序列。

这种方法扩展性很强。PaLM在思维链提示的助力下,在StrategyQA中的准确率达到了75.6%,在体育问题方面的准确率更是高达95.4%,超过了人类专家。对于复杂的数学问题,它能通过清晰的步骤推理予以解决。在常识性任务中,原本隐含的假设能够以自然语言呈现出来,而符号问题也变得通俗易懂。

实用价值:Wei等人的工作在多个领域展现出了突破性成果。LaMDA 137B就是一个例证,它通过合理的逻辑推理得出了96%的正确答案,让解题过程清晰透明。而且,规模更大的模型能给出更具连贯性的解释。

权衡取舍:逻辑推理过程有时会出现失误,模型也可能陷入混乱状态。据Wei的研究,在错误答案中,有46%存在轻微差错,而54%则有着重大的逻辑漏洞。顺序逻辑推理的方式可能会遭遇阻碍,复杂的任务往往会使模型逼近甚至突破其能力极限。

  • 程序化思维(PoT)

工作原理:Chen等人2022年的研究(https://arxiv.org/abs/2211.12588)改变了模型处理数学问题的方式。他们将自然语言转换为可执行程序,以机器级别的精确度解决复杂问题。

过程十分流畅,文字问题直接转换为Python代码,变量捕捉文本中的关键细节,函数体现解题策略,算法从简单描述中逐渐生成,模型精确地协调外部工具。

ac4314d32f3992790b9e815f49541a23.png

PoT创下了新记录,少样本环境下数学基准提升了8%,而在零样本环境下则提高了12%。代码以结构化逻辑讲述了一个完整的推理过程,控制流与人类思维路径高度契合。程序既是解决方案,也是解释过程。

PAL进一步拓展了这一点。Gao等人在2023年(https://arxiv.org/abs/2211.10435)展示了模型如何借助Python解释器提升逻辑推理能力,使复杂计算更加精准。形式化的数学运算可以自然地表达。

实用价值:精确性是关键。数学问题自然地转化为代码,模型将高阶逻辑推理与计算准确性结合在一起,仿佛数学家与超级计算机并肩工作。

权衡取舍:有些问题无法很好地转化为代码。执行程序会引发安全问题。模型必须同时处理自然语言和代码,这会增加出错的风险。

2.2. 一致性和验证方法

  • 自一致性(Self-Consistency)

工作原理:Wang等人(https://arxiv.org/abs/2203.11171)于2022年引入了SC,从贪婪解码转向统计抽样。这种方法彻底改变了推理过程。

每一步不再只有一个解,而是产生多条路径。自一致性方法能同时探索多种逻辑推理路径,解码器在概率空间中采样不同的轨迹。通过重复步骤来减少错误,并通过采样进行验证,从而提高准确性。

51eba2098162e2055514bd6b8066494e.png

SC具有坚实的统计基础。它通过对样本进行边缘化处理,来减少单一路径中的错误。可以将其类比于量子力学:多个路径同时存在,真相在统计模式中逐渐显现。

他们的方法具有突破性。解码器生成n条独特的逻辑推理链,每条链遵循不同的概率路径。最终答案通过多数投票得出,但这一过程并不仅仅是简单的计数,而是综合了多种推理结果。

Wang团队测试了从UL2-20B到PaLM-540B的多个模型,整体准确率均有所提升。小型模型的提升最为显著,这表明自一致性方法可以激发各类模型的潜在能力,无论模型大小都能受益。

实用价值:数字说明了一切。多条路径会自动验证答案。不同的路径可以捕捉到边缘情况。探索的路径越多,稳健性就越高。数量转化为质量。

权衡取舍:计算成本增加。每条路径都需要资源。内存使用量激增。有时会出现矛盾的路径。解决这些冲突会增加复杂性。

  • 自背书(Self-endorsement)
     

工作原理:Wang等人于2024年(https://arxiv.org/abs/2402.15631)提出了自背书(SE)这一新的验证方法。系统生成多样化的回应,然后对其进行分析。事实被提取、标记并相互比较。通过跨回应验证,为每个事实分配支持分数。

SE使用了先进的事实提取算法。神经检索技术识别关键陈述,自动交叉引用帮助模型区分强事实与弱事实。这个统计验证过程推动了系统的高效运作。

高分事实会影响未来的输出,而低分事实则会触发重新评估。每次传递通过一致性来细化模型的响应。

事实提取过程技术复杂。命名实体识别用于识别关键元素,关系抽取则用于映射这些元素之间的联系,整个过程完全自动化,无需人工干预。

7fcae6450589934268db6ad7a777d9e5.png

实用价值:提高准确性,减少幻觉现象。系统能够自我验证事实,通过置信分数使回应更加可靠。

权衡取舍:处理时间更长,事实提取有时会失败。复杂陈述难以简单验证,某些符合实际的事实可能因不符合统计模式而被误判为无效。

  • 由少到多提示法(Least-to-Most Prompting)

工作原理:Zhou等人于2022年(https://arxiv.org/abs/2205.10625)提出了由少到多提示法(LM),该系统将任务分解为更小的部分,并逐步解决每个部分。

该过程分为多个阶段。首先,模型分析输入内容;接着,识别子任务;然后逐一解决每个部分;最后,将各部分结果整合。每个阶段都基于前一个阶段的输出,逐步推进。

a1952014a390ee7ad3db47c83af4104d.png

例如,在处理“cat dog bird”这样的“取词尾字母”任务时,模型会分别处理每个单词,从“cat”得到“t”,从“dog”得到“g”,从“bird”得到“d”,然后将它们组合成“tgd”。模型在包含四个单词的情况下达到了94%的准确率,即使包含十二个单词也能保持74%的准确率。

错误是可以预测的。有时字母会在连接过程中丢失,有时会出现多余的字母。但模型很少会混淆每个单词的最后一个字母。

实用价值:LM方法非常高效,仅需两个示例即可良好运行。相比传统方法,它使用的token更少,却能达到甚至超过相同的效果。

扩展性令人印象深刻。该模型能够处理比训练示例长四倍的序列,且不损失准确性。标准方法在长序列上的表现较差,十二词测试仅达到31.8%的准确率,而LM达到了74%,且在更复杂任务中优势逐步扩大。

权衡取舍:某些任务难以拆分,特定问题需要不同的方法。该方法需经过更多步骤,因此增加了处理时间。

技术上的限制随之出现。模型必须跟踪partial方案,且序列越长,内存使用量越大。某些任务需要多次尝试才能找到最佳的拆分方式。

精心的规划至关重要。子任务的顺序会影响准确性,高效的信息管理变得尤为关键。系统必须根据不同问题调整其拆分策略。

2

如何测试逻辑推理能力

自19世纪末实验心理学兴起以来,认知科学一直在研究人类的逻辑推理能力。该领域对技术发展、教育提升、认知障碍治疗以及改善决策具有重要意义。科学家们使用多种工具来研究逻辑推理,包括解决问题的任务、计算模型、大脑成像(fMRI和EEG)以及眼动追踪等行为测量。这些综合方法帮助研究人员深入理解人类的逻辑推理过程。

类似地,AI研究人员也设计了逻辑推理任务,以特殊数据集的形式来测试大型语言模型(LLM)的逻辑推理能力。由于AI更偏向工程学和计算机科学领域,这些数据集为测试AI系统提供了严格的基准,帮助研究人员衡量模型的准确性并识别其可能存在的不足之处。

用于测试AI在某一类型逻辑推理上的数据集应在该类型的逻辑推理任务中具有多样性,以便涵盖任务的不同复杂性和细微差别。例如,为评估语言模型的常识逻辑推理能力,可以使用ARC数据集(https://paperswithcode.com/dataset/arc)。下图展示了在ARC挑战数据集上,不同来源的最佳大型语言模型排名。

推理时技术用绿色表示,训练时技术用橙色表示,标准基础模型用蓝色表示。

ec6a46b93a27cbd8ad86f37077024054.png

在上图中,表现最好的技术是推理时的方法,尤其是自一致性方法(SC)相比标准链式推理(CoT)具有明显优势。微调方法难以与推理时的方法匹敌,后者展现了明显的优越性。
 

3

总结

我们的研究聚焦于通过三种方式加强LLM的逻辑推理能力。首先是算术逻辑推理——通过逻辑解决数学问题;其次是常识逻辑推理——理解日常情境并得出结论;最后是符号逻辑推理——通过严格逻辑处理抽象符号。

我们探索了两种推进这些领域的策略。第一种是训练时方法,这些方法能调整AI的学习过程,使其适应特定任务,但需要时间和计算资源。例如,WizardMath教授数学问题的详细解决方法,PEFT(参数高效微调)则在不需要大量资源的情况下构建技能。DCoT(发散性思维链)允许AI同时考虑多个解决方案。

第二种方法是推理时方法。这些方法通过增强现有模型来带来快速改进,尽管有时深度较浅。思维链(CoT)让AI解释它采取的每一步,思维程序(PoT)让AI编写并运行代码以提高准确性。自一致性检查多个路径以确保答案的可靠性。

下面的表格是我们研究成果的总结。

9f74cb7597ddf57d47bf9a493ace7be3.png

(增强AI逻辑推理的技术)

通过将我们的AI逻辑推理研究开源,Bagel团队旨在与开源AI社区合作,共同开创人类的下一章。

其他人都在看


让超级产品开发者实现“Token自由”
 

邀请好友体验SiliconCloud狂送2000万Token/人

邀请越多,Token奖励越多
siliconflow.cn/zh-cn/siliconcloud

相关推荐

<span class=“js_title_inner“>OpenAI 前首席研究官:AGI 核心突破已实现</span>

归根结底,与人合作时要理解他们的诉求,既要让他们实现创作目标,又要协调所有人的贡献形成整体成果,并持续反复地解决这个问题。但如果他们知道你是在为他们争取最大利益,那么当你要求他们去做那件极其困难且令他们恐惧的事情时,有时你就能帮助他们跨越鸿沟,解决问题,避免他们做出愚蠢的举动,最终获得圆满的结果。,包括在实现方式上的品味,其中可能存在不明显的后果——也许是性能上的隐性影响,也许是用户界面演变过程中难以预见的连锁反应,进而需要改变系统更深层的抽象结构——这些只能依靠人类来完成,目前别无选择。

OneFlow深度学习框架 721

<span class=“js_title_inner“>OpenAI 前首席研究官:AGI 核心突破已实现</span>

归根结底,与人合作时要理解他们的诉求,既要让他们实现创作目标,又要协调所有人的贡献形成整体成果,并持续反复地解决这个问题。但如果他们知道你是在为他们争取最大利益,那么当你要求他们去做那件极其困难且令他们恐惧的事情时,有时你就能帮助他们跨越鸿沟,解决问题,避免他们做出愚蠢的举动,最终获得圆满的结果。,包括在实现方式上的品味,其中可能存在不明显的后果——也许是性能上的隐性影响,也许是用户界面演变过程中难以预见的连锁反应,进而需要改变系统更深层的抽象结构——这些只能依靠人类来完成,目前别无选择。

OneFlow深度学习框架 408

<span class=“js_title_inner“>LLM 推理经济学</span>

作者 | Piotr Mazurek & Felix GabrielOneFlow 编译翻译|张雪聃题图由 SiliconCloud 生成当前 LLM 公司的主要商业模式是通过 API 提供模型访问服务,推理成本结构是决定其盈利能力的关键。本文将从底层原理阐释大模型托管/服务的成本来源、单个 GPU 可生成的词元(Token)数量及其成因,本文以开源模型 LLaMA 3.3 为基础,搭建一个简化版的大模型推理运算世界模型,旨在建立关于 LLM 推理的精确直觉认知。大模型推理的经济学影响远超过技术范畴本身。随

OneFlow深度学习框架 632

Databricks“三级跳”:600 亿美元独角兽的战略跃迁

本文以 S 曲线理论为分析框架,深度解构 Databricks 的三次关键战略跃迁,还原了其技术商业化路径中的关键决策——如拒绝本地化部署的短期利益、与微软 Azure 的生态合作以及从开源社区到企业级服务的平衡艺术。Databricks 作为数据与 AI 领域的代表性企业,从开源项目 Spark 起步,逐步发展为估值超 600 亿美元的行业巨头,其成长历程不仅折射出大数据技术的演进史,更揭示了科技公司如何通过连续的战略跃迁实现指数级增长。当时的背景是:互联网的迅速发展催生了海量数据,尤其是非结构化数据。

OneFlow深度学习框架 1199

AI 云服务之争:CoreWeave 向上,Nebius 向下

平台中的大多数工具均为自主研发,包括支持大规模调度的托管 Kubernetes、基于 Slurm 的集群调度系统、用于实验管理的 MLflow、自研的可观测性工具,以及一个具备安全保障的云端基础设施控制平台。它跳过了这一环节,设计了自己的服务器机架,以建立一个更加垂直整合的系统,从数据中心架构到托管式 Kubernetes 服务,再到像 Nebius AI Studio 这样的应用层工具(该工具为 DeepSeek、Llama 和 Flux 这样的开源模型提供推理 API)。的策略更全面和“全栈”。

OneFlow深度学习框架 2065

<span class=“js_title_inner“>AI 云服务之争:CoreWeave 向上,Nebius 向下</span>

平台中的大多数工具均为自主研发,包括支持大规模调度的托管 Kubernetes、基于 Slurm 的集群调度系统、用于实验管理的 MLflow、自研的可观测性工具,以及一个具备安全保障的云端基础设施控制平台。它跳过了这一环节,设计了自己的服务器机架,以建立一个更加垂直整合的系统,从数据中心架构到托管式 Kubernetes 服务,再到像 Nebius AI Studio 这样的应用层工具(该工具为 DeepSeek、Llama 和 Flux 这样的开源模型提供推理 API)。的策略更全面和“全栈”。

OneFlow深度学习框架 142

关于 DeepSeek-R1 API 评测,至少有 7 个误区

xx 58.33%。以某评测者的“人类头发数量的乘积是多少?市面上基本不存在“非满血版 R1”,也基本不存在所谓模型“降智”,而 R1 蒸馏版(70B、1.5B等)与满血版的效果差距很明显,一般知名服务商都会注明,如果这些平台提供所谓“非满血版 R1”,很容易测试出来,这完全是自砸招牌,他们没有动机“以次充好”。可以确定的是,市面上知名的第三方平台部署的都是“满血版 R1(671B)”,之所以用户使用感受有差异,是因为模型输出的随机性、平台提供的配套功能及超参数设置等可能不一致,而非底层模型本身的差异。

OneFlow深度学习框架 1123

<span class=“js_title_inner“>关于 DeepSeek-R1 API 评测,至少有 7 个误区</span>

xx 58.33%。以某评测者的“人类头发数量的乘积是多少?市面上基本不存在“非满血版 R1”,也基本不存在所谓模型“降智”,而 R1 蒸馏版(70B、1.5B等)与满血版的效果差距很明显,一般知名服务商都会注明,如果这些平台提供所谓“非满血版 R1”,很容易测试出来,这完全是自砸招牌,他们没有动机“以次充好”。可以确定的是,市面上知名的第三方平台部署的都是“满血版 R1(671B)”,之所以用户使用感受有差异,是因为模型输出的随机性、平台提供的配套功能及超参数设置等可能不一致,而非底层模型本身的差异。

OneFlow深度学习框架 125

首发!硅基流动 x 华为云联合推出基于昇腾云的 DeepSeek R1 & V3 推理服务

DeepSeek-R1、DeepSeek-V3 开源后引发全球震动,它们是深度求索团队为全人类献上的一份大礼,我们由衷为他们取得的成功感到高兴。经过硅基流动和华为云团队连日攻坚,今天,我们也为国内用户献上春节礼物:大模型云服务平台 SiliconCloud 首发上线基于华为云昇腾云服务的 DeepSeek-V3、DeepSeek-R1。 需要特别强调的是,无论是在昇腾上适配 DeepSeek-R...

OneFlow深度学习框架 4212

<span class=“js_title_inner“>首发!硅基流动 x 华为云联合推出基于昇腾云的 DeepSeek R1 & V3 推理服务</span>

5. 与 DeepSeek 官方优惠期价格保持一致,SiliconCloud 上的 DeepSeek-V3 的优惠期价格(截止 2 月 8 日 24:00)为 ¥1 / M tokens(输入)& ¥2 / M tokens (输出),DeepSeek-R1 的价格为 ¥4 / M tokens(输入)& ¥16 / M tokens (输出)。华为云昇腾云服务可提供澎湃、弹性、充足的算力。双模型,还是在此前上线其他模型的过程中,我们都得到了 DeepSeek 与华为云的大力支持,向他们致以深深的谢意与。

OneFlow深度学习框架 114

站在 AI 十字路口:直面智能体与机器人狂潮

生成式 AI 正在迅速介入人类世界。随着 AI 大模型不断进步,我们正面临着巨大的社会变革。本文探讨了一个由高度智能的智能体和机器人主导的世界——AI 亚特兰蒂斯世界(指在数字领域拥有几乎无限的 AI 资源)。本文分析了当前的 AI 模型为何从根本上不同于以往的技术范式,它们如何重塑各行业,以及人类面临的关键选择。作者认为,每个人都必须理解 AI 的进步将如何重塑经济、创造力和人类潜力的规则。除...

OneFlow深度学习框架 590

<span class=“js_title_inner“>站在 AI 十字路口:直面智能体与机器人狂潮</span>

拥有 AI 的政府能够提供更好的服务,制定数据驱动的政策,增强国家安全,并为民众提供更高的透明度和问责制。这里有一个令人难以置信的想法:你现在可以雇佣智能体员工和机器人工作者,他们的薪水甚至低于你花在咖啡上的费用——然而他们却拥有与普通大学毕业生相同的技能。拥有更多的闲暇时间当然不错,但真正的关键是,AI 为你腾出了精神空间,让你能专注于更大的挑战。像 ComfyUI 这样的工具是这一转变的早期例子——人们现在可以创建复杂的 AI 工作流,其中信息和任务从一个阶段无缝流向另一个阶段。这些模型是通用翻译器。

OneFlow深度学习框架 81

迈向 AI 驱动型经济:当资本不需要打工人

AI 的迅猛发展与普及,引发了学术界与工业界对现在的社会结构与经济模型的根本性反思。此前 OneFlow 发布的《资本、AGI 与人类雄心》、《AGI 时代的智能诅咒》、《AGI 崛起之后:重构经济模式与社会结构》三篇文章,深入探讨了劳动力替代性 AI 改变人力与非人力生产要素的相对重要性后,给整个社会带来的好处与风险,以及应对挑战的解决方案。在本文中,借助一众经济学家和科幻作家的理论观点,Int...

OneFlow深度学习框架 1013

<span class=“js_title_inner“>迈向 AI 驱动型经济:当资本不需要打工人</span>

相对而言,伊恩·M·班克斯(https://en.wikipedia.org/wiki/Iain_Banks)的《文明》系列丛书则描绘了一个后匮乏的社会,在这个社会中,拥有感知能力的 “AI 智能体(AI Minds)” 管理着星舰和栖息地,根据需求分配资源,而非货币。例如,《星际迷航》中,技术(如复制器和先进的星舰 AI )消除了物质匮乏,推动了一个专注于探索和文化发展的社会。而 AI 的引入,使非人类智能体成为生产力的主要推动者,将剩余价值的核心转移到了算法、数据集和计算系统的所有权上。

OneFlow深度学习框架 91

AGI 崛起之后:重构经济模式与社会结构

AGI 日益临近,这也迫使我们重新审视现有的社会结构和经济模式。在《资本、AGI 与人类雄心》一文中,Rudolf 指出,AGI 到来之后,劳动力替代性 AI 将改变人力与非人力生产要素的相对重要性,这会降低社会对人类的关注度,同时使现有的权力更加有效和根深蒂固。基于资源诅咒现象,Luke Drago 在《AGI 时代的智能诅咒》一文中将 Rudolf 的上述核心观点描述为智能诅咒。他认为,智能诅...

OneFlow深度学习框架 1297

AGI 时代的智能诅咒

经济学研究指出,依赖出售石油等自然资源获得收入而非公民税收的国家,会受到资源诅咒的影响,结果是权贵们攫取了大量财富,却停止了对普通人的投资。当 AGI 实现后,人类是否会面临类似的“智能诅咒”?在此前发布的《资本、AGI 与人类雄心》一文中,Rudolf 指出,AGI 到来之后,劳动力替代性 AI 将改变人力与非人力生产要素的相对重要性,这会降低社会对人类的关注度,同时使现有的权力更加有效和根深蒂...

OneFlow深度学习框架 751

资本、AGI 与人类雄心

通用人工智能(AGI)正在不可阻挡地走向人类社会,有人期待它带来的巨大生产力突破,有人也在警告它可能成为洪水猛兽,也有人对它的发展只是持观望态度。不管怎样,基于你所了解的信息,你可以尝试描绘一幅 AGI 图景,并畅想它在人类政治、经济、社会发展会产生的影响。在本文中,作者 Rudolf 深入剖析了 AGI 到来之后的资本、人类劳动与社会权力结构之间的复杂关系。其核心观点是,劳动力替代性 AI 将改...

OneFlow深度学习框架 870

2025 年 AI 十大展望:软件市场扩大 10 倍、系统比模型更重要、OpenAI 先发优势消退...

尽管有 Scaling Law 放缓这样的疑虑,但整体而言,多数业内人士对AI过去一年的诸多进展感到兴奋,对新的一年 AI 的发展更是充满期待,尽管他们对未来的预测可能不尽相同。在本文中,Foundation Capital 合伙人Ashu Grag回顾了 2024 年 AI 发展的里程碑事件,并重点介绍了 2025 年的前景,主要包括:1.预训练局限将推动新的 AI 突破2.AI系...

OneFlow深度学习框架 1576

900页免费“生成式AI与大模型”电子书|OneFlow年货

难以想象,如果不是Scaling Law放缓,2024年AI领域会发生哪些惊人变化,但你可能又会感到庆幸,正是由于Scaling Law放缓,它给了这个行业的后来者们追赶的机会,也给了更多普通人搭乘这一轮技术革命的机会。AI领域的变化激荡人心。一年前,AI社区普遍认为,与OpenAI的模型相比,大部分模型与它有半年或一年的差距,但大模型预训练逐渐没有秘密,它的入局门槛数量级降低。令国内外科技界深感...

OneFlow深度学习框架 639

2024年AI盘点:投资高歌猛进、基础设施重构、技术采用加速

本文全面分析了今年AI 的发展,包含AI 技术栈的基础设施层、基础模型层、应用层、工具层,尤其是各个层面的主要收获、值得关注的趋势与值得关注的初创公司。此外,本文还概括了 AI 领域的投资和并购情况,以及其他AI 趋势。需要指出的是,可能限于作者KelvinMu的关注重心,本文除了对中国基础模型的介绍,没有更多关于中国 AI 其他技术栈的进展。不过,这并不妨碍本文仍是我们了解 2024...

OneFlow深度学习框架 1982

从零实现极速LLM推理

作者 | Andrew Chen翻译|张雪聃、刘乾裕OneFlow编译题图由SiliconCloud平台生成本文旨在从零开始,仅使用C++和CUDA构建一个大语言模型(LLM)推理引擎,且不借助其他外部库。为何要这样做?通过这种方式,我们能够全面了解LLM推理的整个技术栈——这一点正变得日益重要[1]——从CUDA kernel到模型架构,并且切实体会不同的优化方式如何影响推理速度。其中一个最为重...

OneFlow深度学习框架 1177

AI数据中心历史、技术与关键企业

过去一年,通过模型架构创新、更优质训练数据和更大算力规模来训练模型,顶尖大模型之间的性能差距急剧缩小。如果Scaling law依然有效,为了进一步扩展模型规模与性能,在模型架构创新存在极大不确定性情况下,通过获得更多的算力来建造全新的数据中心,从而更快地训练模型以取得领先地位,这是确定性更高的收益。目前,以马斯克xAI为代表的大模型公司,快速部署了10万台GPU集群,成为数据中心扩展的领头羊,可...

OneFlow深度学习框架 941

红杉资本2025年AI三大展望:大模型厂商各显神通;杀手级应用AI搜索;AI支出变稳...

2024年,随着Scaling law放缓,AI领域在大模型、基础设施上的能力稳步提升,尽管应用层出现了各种有趣的探索,但是更大的潜能有待挖掘。2025年即将来临,将出现哪些变化?近日,红杉资本投资人David Cahn对2024年AI领域的发展作了简要总结并对2025年作了三大预测。他认为,今年是AI发展的萌芽期,其构建基石已经稳固建立,只待2025年发芽结果。他在本文中阐述了三点预言:首次,基...

OneFlow深度学习框架 1654

AI半导体技术、市场与未来

过去两年,英伟达崛起是科技领域的一个经典案例。通过CUDA系统,他们创建了一个使用GPU进行机器学习的开发者生态系统;通过Mellanox,他们成为了数据中心网络的领导者。然后,他们将所有硬件集成到服务器中,提供垂直集成的算力一体机。凭借这一系列组合性技术优势,英伟达在“AI淘金热”中提供的铲子占据行业核心地位,这导致它成为有史以来最成功的公司之一。随之而来的是,不少挑战者入局以求从英伟达主导的市...

OneFlow深度学习框架 1万+

比GPU快20倍?d-Matrix推理性价比分析

AI推理算力需求正在大幅增长。一方面,像硅基流动、Fireworks这样的AI基础设施软件公司通过软件层面的优化以提供高性价比的大模型推理服务,另一方面,以Cerebras、Groq为代表的芯片公司相继推出了专用AI推理芯片,通过硬件层面的创新,以数量级的推理速度与成本优势来挑战英伟达GPU的市场地位。AI推理芯片市场的竞争者还在增加。近日,成立于2019年的硅谷推理芯片创业公司d-Matrix的...

OneFlow深度学习框架 2003

生成式AI推理技术、市场与未来

OpenAI o1、QwQ-32B-Preview、DeepSeek R1-Lite-Preview的相继发布,预示着生成式AI研究正从预训练转向推理(Inference),以提升AI逻辑推理(reasoning)能力,这一转变将极大推动上层应用的发展。红杉资本近期指出,在可预见的未来,逻辑推理和推理时计算将是一个重要主题,并开启生成式AI的下一阶段。新一轮竞赛已然开始。那么,在推理这一新兴市场,...

OneFlow深度学习框架 2072

50张图,直观理解混合专家(MoE)大模型

Mixtral 8x7B的高效训练与推理效果曾引发AI社区对混合专家(MoE)模型的广泛关注,后来居上的国产开源大模型De‍epSeek以及腾讯近期开源的Hunyuan-Large(基于Transformer的最大MoE模型)也选择了MoE框架路线。为何大语言模型总是离不开MoE的身影?借助50多个图例,数据科学家Maarten Grootendorst由浅入深多维度剖析了MoE模型,从基础概念出...

OneFlow深度学习框架 9321

LLM后训练绝招:1%预训练成本,实现最高20倍算力扩展效果

根据规模定律,扩大训练计算规模可以提高大型语言模型(LLM)性能的关键,但调研机构Epoch AI的研究,LLM再训练无需高额费用,也能让AI能力获得显著提升。在该研究中,他们引入了一个基本框架,用于量化后训练增强的收益和成本,特别是通过计算等效增益来衡量收益。他们将该框架应用于一系列具有代表性的后训练增强,并发现性能提升非常显著,但微调成本通常与预训练成本相比非常小,某些后训练增强技术可以在不到...

OneFlow深度学习框架 4599

探索AI框架前沿|OneFlow招聘深度学习研发工程师(实习)

一、岗位名称:深度学习研发工程师-框架开发方向(实习)岗位职责1. 参与 OneFlow 框架开发、重构与性能优化;2. 参与深度学习编译、高阶自动微分等深度学习框架相关技术演进工作。岗位要求1. 计算机或电子通信相关专业,本科及以上学历;2. 具备C/C++、Python编程基础,有良好的软件开发素养,熟悉TDD、CI/CD、敏捷开发流程等;3. 了解深度学习模型,有一定机器学习基础;4. 熟悉...

OneFlow深度学习框架 550

企业生成式AI最新调查:AI支出激增6倍,多模型部署盛行

企业AI格局正在迅速重塑。随着实验项目逐步落地投入生产,海外风险投资机构‍Menlo Ventures最新发布的《2024年企业生成式AI现状》报告对600名企业IT决策者展开了调研,深入分析了这场变革中正在浮现的新赢家与失利者。(本文由OneFlow编译发布,转载请联系授权。原文:https://menlovc.com/2024-the-state-of-generative-ai-in-the...

OneFlow深度学习框架 5728
上一篇: 企业生成式AI最新调查:AI支出激增6倍,多模型部署盛行
下一篇: 探索AI框架前沿|OneFlow招聘深度学习研发工程师(实习)
OneFlow深度学习框架
OneFlow深度学习框架 企业官方账号 企业官方账号
博客等级 码龄6年 5863粉丝 · 385原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值