跳至正文
-
Subscribe to our newsletter & never miss our best posts. Subscribe Now!
78227科技派

AI工具测评 | 科技资讯 | 软件推荐 - 客观真实的科技自媒体

78227科技派

AI工具测评 | 科技资讯 | 软件推荐 - 客观真实的科技自媒体

  • 首页
  • 关于我们
  • 广告合作
  • 联系我们
  • 首页
  • 关于我们
  • 广告合作
  • 联系我们
关

搜索

  • https://www.facebook.com/
  • https://twitter.com/
  • https://t.me/
  • https://www.instagram.com/
  • https://youtube.com/
Subscribe
AI工具测评

Liquid AI端侧智能体:26亿参数手机可跑

作者 admin
2026-08-06 1 分钟阅读
0

2026年8月4日,MIT CSAIL孵化的Liquid AI正式发布LFM2.5-2.6B。这是一款仅有26亿参数、却能在智能手机端完整本地运行的智能体模型,支持规划、工具调用与多步任务,无需调用任何云端API。就在两天前,阿里Qwen3.8-Max以2.4万亿参数冲击云端旗舰;今天Liquid AI用26亿参数证明,AI竞赛的另一条路径同样值得下注。

Table of Contents

Toggle
  • 26亿参数何以叫板9B模型:基准数据说话
  • 端侧速度与架构:把成本从Token账单变成本地吞吐
  • 四阶段后训练:在真实智能体环境中“毕业”
  • 开放权重与生态:开发者的“无云”选择

26亿参数何以叫板9B模型:基准数据说话

LFM2.5-2.6B的预训练数据量达到约34万亿词元,上下文窗口与词表均扩展至128K。其训练配方包括四阶段后训练:监督微调、教师特化、多领域在策略蒸馏,以及在真实智能体环境中运行的强化学习。

官方评测把LFM2.5-2.6B与体量近4倍的对手并列:Gemma 4-E2B-it(51亿)、Gemma 4-E4B-it(80亿)、Qwen3.5-4B(47亿)、Qwen3.5-9B(97亿)。在指令遵循类基准中,它在IFBench(59.17)、Multi-IF(80.07)、IFStruct(85.49)上全部领先。在工具使用与智能体任务中,ToolSandbox 77.83、Claw-Eval 62.85、PinchBench 68.22、BrowseComp+ 26.89均优于两款Gemma,与Qwen系列互有胜负;仅在BFCLv4上以56.88落后Qwen3.5-9B的60.13。STEM方面,AA Omniscience得分-29.50,远超Qwen3.5-9B的-50.43,数学AIME25也达到51.87。唯一的短板是代码,LiveCodeBenchv6 59.41仍低于Qwen3.5-9B的69.86。

这组数据说明:模型能力不再单纯由参数规模决定。LFM2.5-2.6B用更小的体积、更低的内存占用,在工具调用和多步任务上追平甚至反超更大的模型。对企业来说,这直接降低了在终端或私有服务器上批量部署AI代理的门槛:不需要订购昂贵的云端API,也不用担心调用量突增导致成本失控。

端侧速度与架构:把成本从Token账单变成本地吞吐

LFM2.5-2.6B的推理速度同样亮眼。官方测试显示,在Apple M5 Max上解码速度达220词元/秒,AMD Ryzen AI Max+ 395上113词元/秒,手机端仍可保持30词元/秒,全部运行在2.5GB内存以内。GPU侧,单张NVIDIA H100在高并发下接近15000输出词元/秒,约合每天13亿词元。

速度优势来自Liquid AI的LFM2架构:以短卷积为主、搭配选择性注意力层,每个词元维持固定大小的状态,彻底消除传统Transformer的KV缓存开销。长上下文不再意味着显存爆炸,模型也更适合作为常驻后台、持续运行的本地代理。传统大模型在手机上跑长对话时,KV缓存会迅速吃掉数GB显存;LFM2.5-2.6B把这一开销压到常数级,是让“手机里的AI同事”真正可用的关键。

与DeepSeek V4-Flash把API价格压到极低不同,LFM2.5-2.6B直接让边际推理成本趋近于零。这对医疗、金融、政务等隐私敏感场景尤其关键:数据不出设备,也不必为每次调用付费。

四阶段后训练:在真实智能体环境中“毕业”

LFM2.5-2.6B的后训练不是只在静态数据集上优化。第一阶段监督微调的数据量是LFM2.5-8B-A1B的约7倍,重点覆盖工具使用、网页搜索、软件工程和智能体轨迹。第二阶段为每个领域训练专家教师,包括指令遵循、数学、知识幻觉控制、代码、工具调用和长上下文。第三阶段通过多领域在策略蒸馏把多位教师的能力合并到单一学生模型。最后阶段则在Hermes Agent、OpenClaw、Pi等真实智能体环境中进行多轮强化学习,使用GRPO算法,结合LLM评判、程序化检查和安全门控。

训练基础设施也值得一提:整个流程拆分为FSDP训练引擎、SGLang Rollout引擎、verl强化学习框架,以及独立的沙盒服务。模型在沙盒里调用真实工具、执行代码、浏览网页,轨迹会被线性一致性检查和Rollout Routing Replay机制验证后再回传优化。这种“在真实工具链里练出来”的方法,意味着模型面对的不是合成轨迹,而是真实的系统提示、工具调用格式和多轮交互。它解释了为什么LFM2.5-2.6B在代理基准上表现稳定:它不是学会答题,而是学会在真实环境里完成任务。

开放权重与生态:开发者的“无云”选择

LFM2.5-2.6B与基础版本LFM2.5-2.6B-Base已在Hugging Face开放权重下载,并原生支持llama.cpp、MLX、vLLM、SGLang、ONNX、CoreML和Liquid自研的LEAP平台。官方还提供了WebGPU浏览器演示,以及将模型接入OpenAI兼容端点后对接Hermes Agent、OpenClaw、Pi等主流代理框架的指南。

开放权重加上跨平台推理支持,让开发者可以在笔记本、手机、嵌入式设备甚至机器人上直接部署代理。没有API配额焦虑,没有网络延迟,也没有数据离开设备的风险。这种部署方式尤其适合需要7×24小时后台运行、处理大量本地数据的应用。Liquid AI此前已与奔驰、Insilico Medicine等企业合作推进车载与生命科学领域的边缘AI,LFM2.5-2.6B的发布让这类落地多了一个更轻量的选项。

前瞻:LFM2.5-2.6B把“端侧智能体”从概念变成可下载、可运行、可商用的产品。当云端巨头还在卷万亿参数和API定价时,它用26亿参数开辟了一条以隐私、延迟和零边际成本为核心的新战线。下一步要看的是:实际应用中的工具稳定性和多语言表现,能否匹配实验室里的漂亮数字。

信息来源:Liquid AI官方博客(2026年8月4日)、Hugging Face博客(2026年8月4日)、The Agent Times、ai|expert.news。

作者

admin

关注我
其他文章
上一个

白宫敲定AI安全测试框架:智能体越界入侵倒逼监管提速

下一个

谷歌AI一夜巨震:27年元老Jeff Dean离职,Alphabet市值蒸发1800亿美元

近期文章

  • 英伟达35亿美元入股联发科:定制AI芯片战正式打响
  • 前英伟达VP带9000万美元出逃:Veeda押注”世界模型”成具身智能新基建
  • OpenAI自研芯片Jalapeno实测跑赢英伟达:AI推理成本战正式打响
  • AI吞噬现金流:中美巨头单季烧掉1318亿,自由现金流集体转负
  • Anthropic发布MHS标准:AI智能体首次跨入物理世界操控机械臂

归档

  • 2026 年 9 月
  • 2026 年 8 月
  • 2026 年 7 月
  • 2026 年 6 月
  • 2026 年 5 月
  • 2020 年 1 月

分类

  • AI大模型
  • AI工具测评
  • AI教育
  • AI硬件/芯片
  • AI编程工具
  • AI行业动态
  • AI设计/创作
  • SEO/搜索优化
  • 科技教育
  • 科技资讯
  • 赚钱攻略
  • 软件推荐
Copyright 2026 — 78227科技派. All rights reserved. Blogsy WordPress Theme