1. 项目概述:一场被反复验证的认知错位——为什么AI世界注定周期性“入冬”
你有没有发现,每隔十年左右,媒体就会突然集体高呼“AI要改变一切”,接着是融资狂潮、创业公司扎堆、大厂全员All in;然后就是两年内大批项目无声关停、论文引用断崖下跌、招聘JD从“精通Transformer”变成“熟悉Python基础”;再过一阵子,又有人举着新模型说“这次真的不一样了”。这不是玄学,也不是资本作恶,而是我们对“智能”这件事的理解,从根上就和现实存在一道深沟。我做AI工程落地整整十二年,亲手把三个不同阶段的“明星模型”从实验室推到产线,也亲眼看着它们在真实场景里一个接一个地卡在同一个地方:不是算力不够,不是数据太少,而是我们连“问题本身长什么样”都没看清。这篇文章讲的,不是技术瓶颈清单,而是一套更底层的观察框架——它解释了为什么每一次AI热潮都像春天,但每一次退潮都必然结冰。核心关键词早已写在标题里:“AI Winter”不是意外事故,而是系统性认知偏差的自然结果。它适合三类人细读:刚入行想避开坑的工程师、正在评估AI投入价值的产品经理、以及所有被“AGI倒计时”刷屏却隐隐不安的技术管理者。你不需要懂反向传播,但得愿意承认:人类大脑识别一张猫图只要0.1秒,而我们调参三天的模型,在同一张图上可能因为背景里多了一块阴影就彻底认错——这个差距背后,藏着比GPU贵十倍的真相。
2. 历史脉络解构:三次“春寒料峭”的底层逻辑复盘
2.1 第一次寒冬(1970年代):感知机幻觉与符号主义的硬伤
1958年罗森布拉特造出感知机时,媒体标题是《海军展示思考机器》。这台用硬件实现的单层神经网络,能区分简单图形,瞬间点燃全美对“电子大脑”的想象。但明斯基在1969年那本薄薄的《感知机》里只干了一件事:用数学证明单层网络连最基础的异或(XOR)逻辑都无法表达。注意,他没说“未来可能行”,而是直接证伪了当时所有感知机的理论天花板。这导致美国国防部ARPA项目资金在1974年直接腰斩,英国政府委托的Lighthill报告更直白:“AI领域未达成任何承诺”。很多人以为这是技术失败,其实本质是 建模范式错配 。当时的AI信奉“物理符号系统假说”——认为智能=符号操作。于是专家系统用if-else规则堆砌知识库,医生诊断系统里塞进上千条“如果发烧+咳嗽+白细胞升高→可能是肺炎”。但现实里,老中医摸脉时的“滑脉”“涩脉”,根本无法被离散符号定义;急诊室里护士凭直觉喊“这人马上要休克”,靠的是十年积累的微表情、汗液气味、指尖温度变化的综合判断——这些全在符号系统之外。我2012年参与过一个医疗影像辅助诊断项目,团队花半年把放射科医生口述的300条经验转成规则,上线后发现:当患者体位偏斜5度,所有规则失效。最后靠的不是改规则,而是让医生重新看1000例偏斜片,手动标注“哪里偏了、怎么影响判断”,才让模型学会泛化。第一次寒冬教会我的第一课: 当你的方法论连人类最粗糙的直觉都描述不了,所谓突破只是沙上筑塔 。
2.2 第二次寒冬(1980-90年代):专家系统的天花板与知识获取困境
80年代的“AI春天”由专家系统驱动,典型代表是DEC公司的XCON系统,能自动配置VAX计算机,每年省下4000万美元。但很快问题暴露:XCON维护成本三年翻了三倍,因为每新增一款硬件,就要请对应工程师花两周梳理规则,再由知识工程师翻译成代码。更致命的是,当遇到规则库没覆盖的异常组合(比如新型硬盘+老版电源+散热不良),系统直接报错而非降级处理。这引出了AI界著名的“知识获取瓶颈”——人类专家的知识,80%是默会知识(tacit knowledge),比如资深程序员调试时“感觉这里少了个锁”,这种直觉根本无法用语言精确表述。我2008年在制造业做过一个设备故障预测项目,老师傅说“听电机声音不对”,我们录了200小时音频,用MFCC特征+SVM分类,准确率只有63%。后来发现,老师傅真正依赖的是“启动瞬间的啸叫衰减时间”,而我们的采样率刚好漏掉了这个毫秒级瞬态。第二次寒冬的本质,是 将智能简化为知识存储,却忽略了智能最核心的能力:在信息不全时做出合理猜测 。就像你开车时突然窜出一只猫,不会先查《动物行为学手册》再决定刹车,而是基于千万次视觉-运动协同训练形成的反射。专家系统缺的不是知识量,而是这种“知道何时该忽略规则”的元能力。
2.3 当前周期的临界点(2020年代):深度学习繁荣下的三重裂缝
今天的大模型看似无所不能,但裂缝正从三个维度同时扩大。第一是 数据依赖症 :GPT-4训练用了上万亿token,但人类儿童学说话只需几千小时对话。更讽刺的是,我们给模型喂的“高质量数据”,很多来自人工标注——而标注员自己常靠直觉判断(比如“这句话是否含歧视”,不同标注员一致率仅72%)。第二是 因果断裂 :模型能生成“下雨导致地面湿”,但无法回答“如果我没撑伞,淋湿概率会增加多少?”——因为它从不建模变量间的因果机制,只统计共现模式。我2021年帮某保险公司做理赔欺诈检测,模型把“理赔人职业=教师”标为高风险(因历史数据中教师理赔案欺诈率略高),实际调查发现:教师更习惯保留完整票据,反而欺诈率最低。模型学到了虚假相关性。第三是 具身缺失 :所有大模型都在文本空间里打转,但人类智能诞生于身体与环境的持续互动。婴儿通过抓握、摔打、舔舐理解“硬度”“重量”“可食性”,而LLM的“苹果”概念,只是百万个上下文中的词向量平均值。这导致它永远无法真正理解“把盐撒进汤里”和“把盐撒进汽油里”的物理后果差异。当前周期的特殊性在于:裂缝比前两次更深,但掩盖裂缝的资本泡


3万+

被折叠的 条评论
为什么被折叠?



