区块链 区块链技术 比特币公众号手机端

在设备端运行的 Agent 模型 LFM2.5-2.6B

今天,我们发布 LFM2.5-2.6B,一个完全在设备端运行的 agentic 模型。它足够小,可以在手机上运行;足够快,可以在 CPU 上保持流畅响应;也足够强大,能够驱动 agentic 工作流:规划、调用工具以及处理多步任务。

与依赖云端 API 的 Agent 不同,本地 Agent 为你提供免费推理、低延迟和真正的隐私。按 Token 计费的成本被消除后,开发者的构建方式也随之改变:Agent 现在可以在本地硬件上大规模并行化,以零边际成本运行消耗数百万 Token 的后台任务。当 Token 开销不再成为约束,Agent 就可以随时随地全天候运行。

基础模型(LFM2.5-2.6B-Base)和后训练模型(LFM2.5-2.6B)今天已在 Hugging Face 上提供。查看我们的文档,了解如何在本地运行和微调它们。

LFM2.5-2.6B 评估结果

训练

LFM2.5-2.6B 是一个 2.6B 参数的模型,专门针对 agentic 工作负载进行训练。它在大约 34T Token 上进行了预训练。为了更好地支持 LFM2.5 中的非拉丁文字,我们没有从头重新训练模型,而是通过就地扩展现有的 tokenizer 将词表大小翻倍至 128K,采用的流程与 LFM2.5-8B-A1B 相同。中期训练包含一个专门的 128K 上下文扩展阶段,使模型能够处理 agentic 工作负载所需的长输入。

该示意图总结了将 LFM2.5-2.6B-Base 转变为 agentic LFM2.5-2.6B 的四阶段后训练流水线:监督微调(SFT)、教师特化多领域在策略蒸馏(MOPD)和 Agentic 强化学习(Agentic RL)。

LFM2.5-2.6B 训练方案

监督微调

后训练从两个连续的 SFT 阶段开始:首先覆盖所有领域的广泛数据,然后针对 agentic 任务、推理和工具使用等优先级技能进行定向打磨。在这两个阶段中,SFT 训练数据的混合规模约为 LFM2.5-8B-A1B 所用数据的七倍,其中对工具使用、网络搜索、软件工程和 Agent 轨迹等 agentic 任务的权重更高。最终的 SFT checkpoint 既作为学生模型,也作为后续蒸馏阶段训练一组特化教师的初始化 checkpoint。

教师特化

从共享的 SFT checkpoint 出发,我们在重新加权后的混合数据上进行一轮聚焦的 SFT,随后使用带可验证奖励的强化学习(RLVR),为每个目标领域训练一个专家模型。由此产生的专家模型涵盖指令遵循、数学、知识(包括幻觉控制)、代码、工具使用和长上下文。分开训练可以让每个专家在各自领域深度优化,使用针对性的数据和奖励,而不会受到无关目标竞争性更新的干扰。

多领域在策略蒸馏

然后,我们使用这些特化专家作为教师,将它们的知识蒸馏到单个学生模型中。与离策略蒸馏(学生从另一个模型生成的轨迹中学习)不同,MOPD 让学生在其自身策略下进行 rollout。每个 prompt 会被路由到对应领域的教师,由教师以 Token 级别的反馈来监督学生的响应。

由于教师与学生来自同一个 SFT checkpoint,它们的反馈与学生的分布足够接近,既能有效引导学习,又不会破坏训练的稳定性。这种密集的路由式监督帮助学生在快速收敛的同时,将各领域特化的能力整合进单个模型中。

Agentic 强化学习

最后阶段教会模型在真实的 Agent 环境中运行。我们通过真实的 Agent harness 运行多轮 agentic RL,让模型完成现实的生产力任务,以评估其研究、写作、编码、数据分析、文档管理、外部工具使用以及自动化多步工作流的能力。

在训练过程中,我们采样一个任务并随机选择对应的 harness。每次 rollout 都在一个带有独立运行时的专用沙箱中执行。我们使用 GRPO 进行优化,采用基于结果的奖励,该奖励结合了 LLM-as-a-judge 评分标准、程序化检查和硬性安全门控。直接在 Hermes Agent、OpenClaw 和其他 harness 中训练,让模型接触到它们的工具、系统提示词和交互模式,帮助它在各种 Agent 环境中可靠工作。

LFM2.5-2.6B Agentic 强化学习(Agentic RL)

训练流水线将模型优化、推理和环境执行拆分为不同的组件。训练引擎(FSDP)负责优化模型,而 Rollout 引擎(SGLang)使用最新策略生成动作。RL 框架(verl)通过启动 rollout、收集轨迹和奖励以及更新模型来协调训练循环。

动作在沙箱服务中执行,Blackbox Harness 在其中托管 Agent(例如 OpenClaw 或 Hermes Agent),并通过工具调用、代码执行和其他任务特定操作来协调与任务环境的交互。Harness 代理使我们能够将 agentic harness 视为无需修改的黑盒,同时透明地捕获重建和验证 RL 训练样本所需的 Token 级轨迹。这包括线性轨迹一致性检查、Token 不匹配检查和 Rollout 路由重放(R3)。

基准测试

我们在涵盖 STEM、指令遵循、工具使用和 agentic 工作流的基准测试上评估了 LFM2.5-2.6B。尽管它是本次对比中规模最小的模型,但与参数规模接近其四倍的模型相比毫不逊色,并且常常表现更优。

基准测试 LFM2.5-2.6B (2.6B) gemma-4-E2B-it (5.1B) gemma-4-E4B-it (8B) Qwen3.5-4B (4.7B) Qwen3.5-9B (9.7B)
AA-Omniscience-Public -29.50 -74.47 -49.03 -54.30 -50.43
AIME25 51.87 26.33 34.27 49.33 56.07
LiveCodeBenchv6 59.41 54.92 63.77 60.85 69.86
IFBench 59.17 34.08 39.24 48.40 56.47
Multi-IF 80.07 69.44 77.35 55.67 62.55
IFStruct 85.49 64.85 76.65 36.25 78.50
BFCLv4 56.88 36.98 46.39 50.56 60.13
ToolSandbox 77.83 52.40 65.00 75.55 76.44
τ³-Bench Banking 5.67 3.35 4.12 5.45 5.15
Claw-Eval average (EN) 62.85 53.14 58.02 62.28 66.53
PinchBench 68.22 44.24 55.09 71.26 71.45
BrowseComp+ (OpenClaw) 26.89 8.31 15.90 24.46 27.23

LFM2.5-2.6B 在所有指令遵循基准测试和几乎所有工具使用基准测试上领先,仅在 BFCLv4 上落后于 Qwen3.5-9B。在 agentic 任务上,它全面超越了两款 Gemma 模型,并与 Qwen 系列模型不相上下。在 STEM 方面,它在 AA-Omniscience-Public 上领先,在数学上仅落后于 Qwen3.5-9B。编码是更大模型仍然保持优势的唯一领域。

这些结果使 LFM2.5-2.6B 非常适合边缘设备上的大规模 agentic 工作负载,尤其是在速度、隐私和本地部署至关重要的场景。对于更复杂的 agentic 任务或编码密集型工作负载,更大的模型可能仍然是更好的选择。

随处快速推理

LFM2.5-2.6B 在发布首日即获得推理生态系统的全面支持:

  • llama.cpp — 用于高效边缘推理的 GGUF checkpoint
  • MLX — 针对 Apple Silicon 优化的推理
  • vLLM — 面向生产吞吐量的 GPU 加速服务
  • SGLang — 面向生产吞吐量的 GPU 加速服务
  • ONNX — 跨多种加速器的跨平台推理

CPU 推理。 得益于高效的 LFM2 架构,LFM2.5-2.6B 是我们测试过的在读取 prompt 和生成答案方面最快的模型,在 M5 Max 上解码速度达到 220 Token/秒,在 Ryzen AI Max+ 395 上达到 113 Token/秒,同时内存占用保持在 2.5 GB 以下。即使在手机上也能保持 30 Token/秒的速度,因此一个能力强大的 Agent 可以在你自己的设备上即时、私密地运行。

LFM2.5-2.6B CPU 推理

GPU 推理。 我们还在单个 NVIDIA H100 SXM5 GPU 上使用持续负载设置测量了输出吞吐量(总输出 Token / 实际运行时间):在每个并发级别下,我们持续保持目标数量的并发请求,请求一完成就立即补入新请求。

LFM2.5-2.6B GPU 推理

我们使用 SGLang 0.5.16、1,024 个输入 Token、最多 256 个输出 Token、BF16 精度对每个模型进行基准测试,每个并发级别平均运行 3 次。LFM2.5-2.6B 是同尺寸级别中最快的模型,在高并发下每秒输出近 15K Token,在单个 H100 上每天约可输出 1.3B Token。

使用 LFM2.5-2.6B 运行本地 Agent

LFM2.5-2.6B 的尺寸、速度和能力使其成为边缘设备上大规模 agentic 工作负载的绝佳选择。在下面的演示中,我们将其运行在手机上的 Liquid Agent harness 中,它能够规划、调用工具并完全在设备端完成一个真实任务,全程无需任何云端 API 调用。

搭建你自己的本地 Agent 只需两步。首先,通过兼容 OpenAI 的 endpoint 提供 LFM2.5-2.6B 服务,然后将你的 Agent harness 指向它。它可以开箱即用地与 Hermes Agent、OpenClaw 和 Pi 等流行 harness 配合使用。查看我们的指南,了解如何在本地托管模型并将其与你选择的 Agent harness 连接。

开始使用

立即使用 LFM2.5-2.6B 和 LFM2.5-2.6B-Base 开始构建,现已可在 Hugging Face 上获取。

通过 LFM2.5,我们正在实现「AI 随处运行」的愿景。这些模型具备以下特点:

  • 开放权重 — 无限制地下载、微调和部署
  • 首发即快 — 在 Apple、AMD、Qualcomm 和 NVIDIA 硬件上原生支持 llama.cpp、MLX 和 vLLM
  • 完整的家族 — 从用于定制的基础模型到专门的音频和视觉变体,一个架构覆盖多种使用场景

我们迫不及待地想看到你构建的成果。

在 Hugging Face 下载 · 阅读我们的文档 · 在 Playground 中体验

引用

请按以下方式引用本文:

Liquid AI,"LFM2.5-2.6B: Deploy Agents Everywhere",Liquid AI Blog,2026 年 8 月。

@article{liquidAI202626B,
  author  = {Liquid AI},
  title   = {LFM2.5-2.6B: Deploy Agents Everywhere},
  journal = {Liquid AI Blog},
  year    = {2026},
  note    = {www.liquid.ai/blog/lfm2-5-2-6b},
}
  1. 所有模型均使用 vLLM 和以下生成参数进行评估:
    • BFCLv4:temperature = 0.001,最大输出 Token = 4096。
    • ToolSandBox:temperature = 0,最大输出 Token = 1024。
    • PinchBench:temperature = 0.6,最大输出 Token = 8192。
    • τ³-Bench、Claw-Eval:temperature = 0,无输出限制。Qwen 模型根据推荐设置使用 temperature = 0.6,因为贪婪解码会因 doom looping 而降低性能。
    • 其他评估:temperature = 0.6,最大输出 Token = 32768。
  • 原文链接: liquid.ai/blog/lfm2-5-2-...
  • 鸿途知科网 AI 助手,为大家转译优秀英文文章,如有翻译不通的地方,还请包涵~
版权声明

本文仅代表作者观点,不代表区块链技术网立场。
本文系作者授权本站发表,未经许可,不得转载。

发表评论:

◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。

热门