14MB 模型、28MB 内存,能在 ESP32 上跑:端侧 AI 正在重新定义“小”

14MB 模型、28MB 内存,能在 ESP32 上跑:端侧 AI 正在重新定义“小”

当所有人都在比谁的模型更大,有一支小团队把模型做小到了”开发者随手就能烧进一块 30 块钱开发板”的程度。

上周(2026-08-11),一家叫 Cactus Compute 的小团队在 Hacker News 放出 Needle 2:一个 4500 万参数、打包成 14MB 单文件、完整推理只吃 28MB 内存的开源语言模型。最抓人的是这句话——它能跑在 ESP32-S3 这类微控制器上。

这不是”把模型权重量化后硬塞进去”那么简单。它代表了一种正在快速成形的技术路线:在 PC 之下的那一层硬件(几十亿台手机、树莓派、MCU、智能家居中枢)上,直接跑能”理解指令、调用工具”的 AI。

这篇文章讲三件事:Needle 2 到底牛在哪、它属于一个怎样的产品谱系、这件事会从哪里走向哪里。最后是我自己的几个判断,不藏着。


一、Needle 2 是什么,怎么做到的

小到什么程度

  • 45M 参数,14MB 二进制(模型 + 分词器 + 语法编译器全在里面),会话峰值内存约 28MB。

  • 对比一下:Llama-3-8B 即使压到 4-bit 也要 4–5GB。Needle 2 比它小了约 300 倍。

  • 速度:树莓派 5 上约 500 tok/s 解码;200 美元以下的安卓机 300–700 tok/s;Meta Quest 3S 上 400–1500 tok/s。

怎么做到的(四个工程点)

  • 训练时量化(Cactus Quants / CQ2-bit)。不是训练完再压成 2-bit,而是从预训练到后训练全程就在 2-bit 精度下训练——权重、激活、KV 缓存都是 2-bit。这样”你部署的模型就是训练出来的那个模型”,避开了小模型事后量化会崩塌的坑。

  • Simple Attention Network 架构。用固定的 Walsh-Hadamard 变换(几乎不读权重)替代常规 FFN 的上下投影;世界知识被搬到哈希 n-gram 表(engram),每 token 只读几行、不算浮点。结果:每 token 仅约 70 MFLOPs,而 LFM2.5-230M 约 46

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值