文章目录
P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看, 传送门https://blog.csdn.net/HHX_01
前言
最近我算发现了,打工人的焦虑清单又悄悄添了个新成员——token焦虑。
以前发愁工资不够花,现在操心token不够用;以前办健身年卡纯浪费,现在充AI月卡月月见底。
钱没少花,套餐越办越多,额度反而越来越不够用,合着AI厂商是跟运营商学的套路是吧?
1. 这波爆火的本地模型,到底是什么来头
直到前几天阿里放出来的Qwen3.8-27B,直接把我这点焦虑给干沉默了。
270亿参数的稠密模型,Apache 2.0协议开源,权重随便下,商用也不花钱。
啥叫稠密模型?就是别人干活是抽几个小组轮班摸鱼,它是270亿参数全员上岗,一个都不划水。
1.1 热度有多夸张?说出来你可能不信
发布48小时冲上Hugging Face趋势榜第一,当天直接登顶Hacker News。
LM Studio上线38分钟下载破万,Ollama单渠道5天干了36万下载。
什么概念?就像小区楼下新开个免费生鲜超市,大爷大妈闻讯狂奔,半小时把菜摊围得水泄不通,隔壁区的都坐公交过来抢。
连编程工具Cline都官宣,上线才4天,它就成了开发者选得最多的本地模型。
Ollama、vLLM、SGLang全是发布当天就支持,Cloudflare第一时间收进模型库,AMD官方都出了部署教程。
这待遇,今年开源模型里真没几个能享受到。
1.2 能力边界先给你划清楚
原生多模态,能看懂图片和视频,官方说小时级长视频都能理解。
注意啊,是看懂,不是生成。想让它画图做视频的,可以先散了。
原生上下文262K,官方说用技术能扩展到1M。说白了,262K是原装正品量程,1M属于后期接的延长尺,能用但精度没保证,目前大家实测能用的还是262K。
它还有个2.4万亿参数的大哥,权重也一起放出来了,不过那个体量普通人根本跑不动,27B才是咱们普通人能搬回家的版本。
2. 为啥全网都在喊「本地版Opus 4.6」
现在圈里出新模型,默认都要跟Claude Opus 4.6比一比,它就像行业里的标尺,够不够格,量一下就知道。
2.1 纸面跑分确实猛,但先打对折听
官方放出来的跑分表,看着确实吓人。
SWE-bench Pro拿了61.7,比Opus 4.6 Max的53.4还高;Terminal Bench 73.0,LiveCodeBench直接干到90.3。
多模态也不弱,电脑操作任务84.3分,文档理解91.1分,官方说整体能力超过了自家上一代的付费模型。
但话说在前头,这些都是官方自己跑的分,先打个对折听,别上来就当真。
2.2 实际体验到底怎么样
社区这几天的实测结论还挺一致:日常编程和普通agent任务,跟云端旗舰的差距已经小到要刻意分辨才能感觉出来。
真遇上复杂长推理任务,云端旗舰还是更稳,这个得承认。
我自己装在Mac上试了试,中文写作和基础编程完全够用,就是速度跟云端API比不了。
毕竟本地跑,就像自己在家做饭,干净放心不花钱,但洗菜切菜下锅总得花时间,不能跟外卖半小时送到比。
第三方榜单也出来了,Agentic Index排第7,拿了51分,比前代的28分直接翻了快一倍,也压过了不少热门闭源模型。
准确说,这是本地模型第一次挤进第一梯队,离“干翻所有闭源旗舰”还差得远,但已经足够让人惊喜了。
3. 凭啥270亿参数,能塞进个人电脑
这是我觉得最有意思的地方,也是它能普及的核心原因。
传统稠密模型跑长上下文,为啥容易崩?就像你开会记笔记,每说一句话都原封不动写下来,说的越多本子越厚,最后本子装不下直接罢工。
这个记笔记的本子,就是咱们常说的KV cache。很多模型跑不动长上下文,不是模型本身装不下,是缓存先爆了。
Qwen3.8-27B玩了招狠的:64层里只有16层用全注意力,老老实实记全量笔记,剩下48层全换成了线性注意力,只保留固定大小的状态。
说白了就是,别人每笔流水都存着,它只记最终余额。
这么一搞,KV cache直接砍到同尺寸传统模型的四分之一,27B的身板能扛住262K上下文,全靠这手绝活。
另外还内置了MTP多token预测,相当于自带个草稿手,先打草稿再确认,速度白捡一截。
4. 你的电脑能不能跑?直接对号入座
直接给结论,不用瞎琢磨:
- 24GB显卡或24GB内存的Mac:入场底线,跑4bit量化版大概占17GB,属于站票,能看但别太挑体验
- 32GB的Mac:舒适档,上下文能开得更长,坐票,腿能伸开
- 48GB以上:土豪配置,直接上8bit,质量接近无损,头等舱待遇
- 16GB及以下:别折腾了,拿老年机玩3A大作,纯纯为难自己
4.1 速度大概是什么水平
给大家几个社区实测的锚点,心里有个数:
M4 Max跑MLX 4bit大概23 token/s,M5 Max优化完加MTP能到50‑60 token/s,RTX 5090开MTP甚至能冲到90‑120 token/s。
入门款Mac会慢一些,日常聊天够用,跑长任务就得有点耐心。
这里有个坑:MTP开和不开,速度差接近一倍。
以后看见谁晒超高速度,先问一句开没开MTP,不然很可能是美颜过的数字。
代价也有,开MTP多吃显存,会压缩可用上下文,有利有弊。
至于4bit和8bit怎么选?一句话:内存够就8bit,嫌慢就4bit。
4bit快接近一倍,日常聊天质量差别感知不强,长推理任务偶尔会露怯。
5. 搭配这个工具,才是真正的完全体
这是我最看重的一点,也是它能实现“token自由”的关键。
说出来你可能不信,Qwen自家就有官方编程工具,但官方跑分几乎全是拿Claude Code跑出来的。
等于官方亲自下场告诉你:我家孩子最好的搭档,是隔壁家的工具。
接入也简单到离谱,Ollama原生支持,两行命令直接把Claude Code的后端换成本地模型。
从此以后,没有API费用,没有额度焦虑,不用担心封号,代码不出你家门,agent随便跑,token可劲造。
这不就是咱们天天念叨的token自由?
尤其是代码不能出内网的公司,这套方案基本是目前最值得评估的选择,没有之一。
5.1 说个体感上的关键点
拿它接Claude Code这种agent,决定流畅度的其实不是生成速度,是“读档”速度。
啥意思?agent每干一轮活,都得把前面的聊天记录、工具结果、代码片段从头到尾重读一遍才能开工。
轮数越多,要重读的东西越厚。短任务聊着很顺,上下文堆到几万字之后,每一轮开工前的等待会明显变长。
所以拿来当编程agent后端,内存带宽比每秒生成多少token的数字更值钱。
6. 先别着急冲,缺点我先给你扒干净
新模型发布第一周,吹得再凶都得打对折。我用下来不满意的地方已经攒了好几个。
6.1 默认模式疯狂过度思考,纯纯话痨
有个国外博主实测,让它画个骑自行车的鹈鹕SVG,它搁那疯狂琢磨:
“要不要加同心辅助圆?”“背景要不要加小花小草?”“ motion line放前面还是后面?”
硬生生想了21分钟,烧了两万多个推理token。
合着这模型是天秤座?选个辅助线都要纠结半小时是吧?
同一个提示词,关掉推理档位,两分多钟就完事了,效果也没差多少。
所以日常用,记得把推理强度调到中等或者低,别让它瞎琢磨浪费时间。
6.2 token消耗巨夸张,三倍于前代
有人把3.8和上一代3.6并排测,10个任务3.8能赢9个,答案质量确实升级了。
但代价是,平均token消耗几乎是3.6的三倍。
有个任务3.8想了七分多钟,烧了三万一千多个token,3.6一分半钟七千多个就交卷了。
就像你找了个干活又快又好的师傅,结果人家按工时收费,干一小时顶别人三小时。活是漂亮,钱包也顶不住啊。
好在本地跑只费电不费钱,这个缺点没那么致命。但如果你打算调云端API按量计费,这笔账可得算清楚。
6.3 还有几个小坑提前说
第一个是知识截止。问它训练数据到什么时候,它张嘴就说2026年,再追问2024年之后的具体事,立马露馅。
属于典型的吹牛皮不打草稿,自己不知道自己不知道,用的时候心里有数就行。
第二个是长任务偶有输出截断的情况,属于早期版本的小毛病,等官方修复吧。
还有那个1M上下文,目前还属于PPT数字,听听就行,别当真。
7. 谁该上车,谁看热闹?
最后给大家划个重点,不用瞎跟风:
- 手上有24GB以上显卡或者32GB以上Mac,不想花API钱,想本地跑编程agent的,直接冲
- 公司代码不能出内网的,这套方案可以认真评估
- 16GB内存的,看看热闹就好,没必要折腾
- 只是日常问答写文案的,你现在用的工具就够用,换它纯纯大炮打蚊子
说实话,现在它还替代不了我的生产主力,真干项目,我还是会打开云端API。
但它的意义从来不在当下。
在token越来越不够用、套餐越来越贵的今天,本地模型第一次摸到了“能用”的门槛。
照这个速度发展下去,真正的生产级本地模型,早晚会来。到那时候,智能不用按月订阅,就安安静静住在你自己的电脑里。
这对端侧AI意味着什么,不用我多说了吧。
P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看,传送门https://blog.csdn.net/HHX_01

322

被折叠的 条评论
为什么被折叠?



