嘿,HN,来自仙人掌的亨利在这里!
我们之前发布了Cactus Needle,一个14MB的代理LLM,用于工具调用,设备使用,以及结构化提取手机,可穿戴设备,智能家庭,小机器人和微控制器.
我们得到了非常好的反馈,现在已经采纳了释放针头2的建议。
整个模型是一个单一的14MB 二进制,在RAM的28MB中运行一个完整的会话;在2bit压缩时运行45m参数.
Needle在一款Raspberry Pi 5上点击了500个令牌/秒解码速度,在Meta Quest 3S和Apple Vision Pro等VR设备上坐在400-1,500个令牌/秒之间,在三星A-Series等200分机上距离300-700.
在工具调用和移动设备使用基准上,Needle 2贸易以LFM2.5 230M和Apple Foundation Model等最接近的小模型取胜,均以5x至70x更小,两者均以2bit的f16 vs Needle 2取胜.
针头以我们论文(https://arxiv.org/abs/2607.18363)中的简单关注网络为基础。
Edge AI最近指Macs和PC,但这在当今世界上仅是超过210亿个连接的IOT设备中的15亿,而在新兴市场,大多数手机都不到200美元,没有NPU,廉价的GPU.
其中包括预算电话,Raspberry Pis,微控制器,可穿戴器,雷奇迷你等小型机器人,以及相接的家庭设备.
Needle宽度和深度的常规变速器每令牌花费164MFLOP,即使是被挤到Needle参数计数的一款也花费了87,Needle花费了70.
即使在高端手机上,一个总是在动力预算内生活的助手;每个MFLOP是毫瓦小时,而Needle的每个硬币花费比最小的出品人LLMs少了7x到85x.
更多关于链接中的建筑.
当我们将消费设备的智能结构为有打出参数的函数时, 唯一的困难部分是将一个混乱的句子映射到它们上; 哪个函数,哪个值。
我们的研究发现,如果这样设计,问题就不需要世界知识,也不需要无限制的道具,这就是为什么45M参数就足够了。
Needle 2扩展为结构化取出,其中可以将 schema 传递到工具的位置并模型返回结构化输出.
可以通过提供取出关键字段,除自由行距解码以外的一切的图案来将"针"作为带有enum字段的文本分类模型,作为归纳模型.
每个产品都有自己的工具词汇并微调出针来帮助其在定制任务上实现前沿性能,因此使用python套件(https://github.com/cactus-compute/nectle),针头可以在几分钟到几小时内被微调出Mac/PC上的针头,有自动的数据生成管道,只需通过几个样本.
然而,每一次反应都包含着我们仙人掌混合技术 所学出的信任分数。
如果超过你的门槛, 行动, 低于它, 升级到云或更大的模型。
将针头2与私人的DeepSeek-v4-Flash部署相结合,对企业一级的任务特别有效,几乎不惜任何代价,我们可以帮助进行这种设置。
我们把许多想法投入了"针头2"中,但可能还是会漏掉很多,请利用所提供的链接中的游乐场来测试"针头",分享你的想法,永远欣赏!
评论 URL: https://news.ycombinator.com/item?id=49246804 点:136# 评论:66