在设备端运行的 Agent 模型 LFM2.5-2.6B
今天,我们发布 LFM2.5-2.6B,一个完全在设备端运行的 agentic 模型。它足够小,可以在手机上运行;足够快,可以在 CPU 上保持流畅响应;也足够强大,能够驱动 agentic 工作流:规划、调用工具以及处理多步任务。
与依赖云端 API 的 Agent 不同,本地 Agent 为你提供免费推理、低延迟和真正的隐私。按 Token 计费的成本被消除后,开发者的构建方式也随之改变:Agent 现在可以在本地硬件上大规模并行化,以零边际成本运行消耗数百万 Token 的后台任务。当 Token 开销不再成为约束,Agent 就可以随时随地全天候运行。
基础模型(LFM2.5-2.6B-Base)和后训练模型(LFM2.5-2.6B)今天已在 Hugging Face 上提供。查看我们的文档,了解如何在本地运行和微调它们。

训练
LFM2.5-2.6B 是一个 2.6B 参数的模型,专门针对 agentic 工作负载进行训练。它在大约 34T Token 上进行了预训练。为了更好地支持 LFM2.5 中的非拉丁文字,我们没有从头重新训练模型,而是通过就地扩展现有的 tokenizer 将词表大小翻倍至 128K,采用的流程与 LFM2.5-8B-A1B 相同。中期训练包含一个专门的 128K 上下文扩展阶段,使模型能够处理 agentic 工作负载所需的长输入。
该示意图总结了将 LFM2.5-2.6B-Base 转变为 agentic LFM2.5-2.6B 的四阶段后训练流水线:监督微调(SFT)、教师特化、多领域在策略蒸馏(MOPD)和 Agentic 强化学习(Agentic RL)。

监督微调
后训练从两个连续的 SFT 阶段开始:首先覆盖所有领域的广泛数据,然后针对 agentic 任务、推理和工具使用等优先级技能进行定向打磨。在这两个阶段中,SFT 训练数据的混合规模约为 LFM2.5-8B-A1B 所用数据的七倍,其中对工具使用、网络搜索、软件工程和 Agent 轨迹等 agentic 任务的权重更高。最终的 SFT checkpoint 既作为学生模型,也作为后续蒸馏阶段训练一组特化教师的初始化 checkpoint。
教师特化
从共享的 SFT checkpoint 出发,我们在重新加权后的混合数据上进行一轮聚焦的 SFT,随后使用带可验证奖励的强化学习(RLVR),为每个目标领域训练一个专家模型。由此产生的专家模型涵盖指令遵循、数学、知识(包括幻觉控制)、代码、工具使用和长上下文。分开训练可以让每个专家在各自领域深度优化,使用针对性的数据和奖励,而不会受到无关目标竞争性更新的干扰。
多领域在策略蒸馏
然后,我们使用这些特化专家作为教师,将它们的知识蒸馏到单个学生模型中。与离策略蒸馏(学生从另一个模型生成的轨迹中学习)不同,MOPD 让学生在其自身策略下进行 rollout。每个 prompt 会被路由到对应领域的教师,由教师以 Token 级别的反馈来监督学生的响应。
由于教师与学生来自同一个 SFT checkpoint,它们的反馈与学生的分布足够接近,既能有效引导学习,又不会破坏训练的稳定性。这种密集的路由式监督帮助学生在快速收敛的同时,将各领域特化的能力整合进单个模型中。
Agentic 强化学习
最后阶段教会模型在真实的 Agent 环境中运行。我们通过真实的 Agent harness 运行多轮 agentic RL,让模型完成现实的生产力任务,以评估其研究、写作、编码、数据分析、文档管理、外部工具使用以及自动化多步工作流的能力。
在训练过程中,我们采样一个任务并随机选择对应的 harness。每次 rollout 都在一个带有独立运行时的专用沙箱中执行。我们使用 GRPO 进行优化,采用基于结果的奖励,该奖励结合了 LLM-as-a-judge 评分标准、程序化检查和硬性安全门控。直接在 Hermes Agent、OpenClaw 和其他 harness 中训练,让模型接触到它们的工具、系统提示词和交互模式,帮助它在各种 Agent 环境中可靠工作。

训练流水线将模型优化、推理和环境执行拆分为不同的组件。训练引擎(FSDP)负责优化模型,而 Rollout 引擎(SGLang)使用最新策略生成动作。RL 框架(verl)通过启动 rollout、收集轨迹和奖励以及更新模型来协调训练循环。
动作在沙箱服务中执行,Blackbox Harness 在其中托管 Agent(例如 OpenClaw 或 Hermes Agent),并通过工具调用、代码执行和其他任务特定操作来协调与任务环境的交互。Harness 代理使我们能够将 agentic harness 视为无需修改的黑盒,同时透明地捕获重建和验证 RL 训练样本所需的 Token 级轨迹。这包括线性轨迹一致性检查、Token 不匹配检查和 Rollout 路由重放(R3)。
基准测试
我们在涵盖 STEM、指令遵循、工具使用和 agentic 工作流的基准测试上评估了 LFM2.5-2.6B。尽管它是本次对比中规模最小的模型,但与参数规模接近其四倍的模型相比毫不逊色,并且常常表现更优。
| 基准测试 | LFM2.5-2.6B (2.6B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | Qwen3.5-4B (4.7B) | Qwen3.5-9B (9.7B) |
|---|---|---|---|---|---|
| AA-Omniscience-Public | -29.50 | -74.47 | -49.03 | -54.30 | -50.43 |
| AIME25 | 51.87 | 26.33 | 34.27 | 49.33 | 56.07 |
| LiveCodeBenchv6 | 59.41 | 54.92 | 63.77 | 60.85 | 69.86 |
| IFBench | 59.17 | 34.08 | 39.24 | 48.40 | 56.47 |
| Multi-IF | 80.07 | 69.44 | 77.35 | 55.67 | 62.55 |
| IFStruct | 85.49 | 64.85 | 76.65 | 36.25 | 78.50 |
| BFCLv4 | 56.88 | 36.98 | 46.39 | 50.56 | 60.13 |
| ToolSandbox | 77.83 | 52.40 | 65.00 | 75.55 | 76.44 |
| τ³-Bench Banking | 5.67 | 3.35 | 4.12 | 5.45 | 5.15 |
| Claw-Eval average (EN) | 62.85 | 53.14 | 58.02 | 62.28 | 66.53 |
| PinchBench | 68.22 | 44.24 | 55.09 | 71.26 | 71.45 |
| BrowseComp+ (OpenClaw) | 26.89 | 8.31 | 15.90 | 24.46 | 27.23 |
LFM2.5-2.6B 在所有指令遵循基准测试和几乎所有工具使用基准测试上领先,仅在 BFCLv4 上落后于 Qwen3.5-9B。在 agentic 任务上,它全面超越了两款 Gemma 模型,并与 Qwen 系列模型不相上下。在 STEM 方面,它在 AA-Omniscience-Public 上领先,在数学上仅落后于 Qwen3.5-9B。编码是更大模型仍然保持优势的唯一领域。
这些结果使 LFM2.5-2.6B 非常适合边缘设备上的大规模 agentic 工作负载,尤其是在速度、隐私和本地部署至关重要的场景。对于更复杂的 agentic 任务或编码密集型工作负载,更大的模型可能仍然是更好的选择。
随处快速推理
LFM2.5-2.6B 在发布首日即获得推理生态系统的全面支持:
- llama.cpp — 用于高效边缘推理的 GGUF checkpoint
- MLX — 针对 Apple Silicon 优化的推理
- vLLM — 面向生产吞吐量的 GPU 加速服务
- SGLang — 面向生产吞吐量的 GPU 加速服务
- ONNX — 跨多种加速器的跨平台推理
CPU 推理。 得益于高效的 LFM2 架构,LFM2.5-2.6B 是我们测试过的在读取 prompt 和生成答案方面最快的模型,在 M5 Max 上解码速度达到 220 Token/秒,在 Ryzen AI Max+ 395 上达到 113 Token/秒,同时内存占用保持在 2.5 GB 以下。即使在手机上也能保持 30 Token/秒的速度,因此一个能力强大的 Agent 可以在你自己的设备上即时、私密地运行。

GPU 推理。 我们还在单个 NVIDIA H100 SXM5 GPU 上使用持续负载设置测量了输出吞吐量(总输出 Token / 实际运行时间):在每个并发级别下,我们持续保持目标数量的并发请求,请求一完成就立即补入新请求。

我们使用 SGLang 0.5.16、1,024 个输入 Token、最多 256 个输出 Token、BF16 精度对每个模型进行基准测试,每个并发级别平均运行 3 次。LFM2.5-2.6B 是同尺寸级别中最快的模型,在高并发下每秒输出近 15K Token,在单个 H100 上每天约可输出 1.3B Token。
使用 LFM2.5-2.6B 运行本地 Agent
LFM2.5-2.6B 的尺寸、速度和能力使其成为边缘设备上大规模 agentic 工作负载的绝佳选择。在下面的演示中,我们将其运行在手机上的 Liquid Agent harness 中,它能够规划、调用工具并完全在设备端完成一个真实任务,全程无需任何云端 API 调用。
搭建你自己的本地 Agent 只需两步。首先,通过兼容 OpenAI 的 endpoint 提供 LFM2.5-2.6B 服务,然后将你的 Agent harness 指向它。它可以开箱即用地与 Hermes Agent、OpenClaw 和 Pi 等流行 harness 配合使用。查看我们的指南,了解如何在本地托管模型并将其与你选择的 Agent harness 连接。
开始使用
立即使用 LFM2.5-2.6B 和 LFM2.5-2.6B-Base 开始构建,现已可在 Hugging Face 上获取。
通过 LFM2.5,我们正在实现「AI 随处运行」的愿景。这些模型具备以下特点:
- 开放权重 — 无限制地下载、微调和部署
- 首发即快 — 在 Apple、AMD、Qualcomm 和 NVIDIA 硬件上原生支持 llama.cpp、MLX 和 vLLM
- 完整的家族 — 从用于定制的基础模型到专门的音频和视觉变体,一个架构覆盖多种使用场景
我们迫不及待地想看到你构建的成果。
在 Hugging Face 下载 · 阅读我们的文档 · 在 Playground 中体验
引用
请按以下方式引用本文:
Liquid AI,"LFM2.5-2.6B: Deploy Agents Everywhere",Liquid AI Blog,2026 年 8 月。
@article{liquidAI202626B,
author = {Liquid AI},
title = {LFM2.5-2.6B: Deploy Agents Everywhere},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/lfm2-5-2-6b},
}
- 所有模型均使用 vLLM 和以下生成参数进行评估:
- BFCLv4:temperature = 0.001,最大输出 Token = 4096。
- ToolSandBox:temperature = 0,最大输出 Token = 1024。
- PinchBench:temperature = 0.6,最大输出 Token = 8192。
- τ³-Bench、Claw-Eval:temperature = 0,无输出限制。Qwen 模型根据推荐设置使用 temperature = 0.6,因为贪婪解码会因 doom looping 而降低性能。
- 其他评估:temperature = 0.6,最大输出 Token = 32768。
- 原文链接: liquid.ai/blog/lfm2-5-2-...
- 鸿途知科网 AI 助手,为大家转译优秀英文文章,如有翻译不通的地方,还请包涵~
版权声明
本文仅代表作者观点,不代表区块链技术网立场。
本文系作者授权本站发表,未经许可,不得转载。
鸿途知科网
发表评论:
◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。