
当所有人都在比谁的模型更大,有一支小团队把模型做小到了”开发者随手就能烧进一块 30 块钱开发板”的程度。
上周(2026-08-11),一家叫 Cactus Compute 的小团队在 Hacker News 放出 Needle 2:一个 4500 万参数、打包成 14MB 单文件、完整推理只吃 28MB 内存的开源语言模型。最抓人的是这句话——它能跑在 ESP32-S3 这类微控制器上。
这不是”把模型权重量化后硬塞进去”那么简单。它代表了一种正在快速成形的技术路线:在 PC 之下的那一层硬件(几十亿台手机、树莓派、MCU、智能家居中枢)上,直接跑能”理解指令、调用工具”的 AI。
这篇文章讲三件事:Needle 2 到底牛在哪、它属于一个怎样的产品谱系、这件事会从哪里走向哪里。最后是我自己的几个判断,不藏着。
一、Needle 2 是什么,怎么做到的
小到什么程度
-
45M 参数,14MB 二进制(模型 + 分词器 + 语法编译器全在里面),会话峰值内存约 28MB。
-
对比一下:Llama-3-8B 即使压到 4-bit 也要 4–5GB。Needle 2 比它小了约 300 倍。
-
速度:树莓派 5 上约 500 tok/s 解码;200 美元以下的安卓机 300–700 tok/s;Meta Quest 3S 上 400–1500 tok/s。
怎么做到的(四个工程点)
-
训练时量化(Cactus Quants / CQ2-bit)。不是训练完再压成 2-bit,而是从预训练到后训练全程就在 2-bit 精度下训练——权重、激活、KV 缓存都是 2-bit。这样”你部署的模型就是训练出来的那个模型”,避开了小模型事后量化会崩塌的坑。
-
Simple Attention Network 架构。用固定的 Walsh-Hadamard 变换(几乎不读权重)替代常规 FFN 的上下投影;世界知识被搬到哈希 n-gram 表(engram),每 token 只读几行、不算浮点。结果:每 token 仅约 70 MFLOPs,而 LFM2.5-230M 约 46


467

被折叠的 条评论
为什么被折叠?



