写点什么

无问芯穹与基元律动联合发布首个 Agent-Native 模型 NeoHorse,探索 Harness 驱动的 RSI 路径

作者:转发
  • 2026-09-10
    北京
  • 本文字数:1192 字

    阅读完需:约 4 分钟

AI摘要

NeoHorse-1是首个Agent-Native模型,通过建模真实Agent执行轨迹(含工具调用、反馈响应与错误修正)实现能力内化,突破传统问答式训练范式。

采用课程学习组织结构化轨迹数据;引入策略蒸馏纠正模型行为偏差;Routing Harness提供高质量Agent轨迹语料。

适合AI架构师、大模型训练工程师、Agent系统研发者阅读。

9 月 8 日,基元律动联合无问芯穹,与清华大学、北京大学、阿里巴巴等机构,推出首个 Agent-Native 模型 NeoHorse-1。该模型包含 4B 和 9B 两个版本,旨在将 Agent 使用工具、接收反馈和修正错误的经验系统性地转化为模型自身能力。

基元律动由前华为诺亚方舟实验室主任、盘古大模型负责人王云鹤创办,公司此前开发的开源 Routing Harness 系统 OpenSquilla,为 NeoHorse 训练提供核心语料;无问芯穹则为 NeoHorse 训练及推理提供底层基础设施支撑与 Infra 优化技术能力。双方联合清华大学、北京大学团队参与算法和训练方法研究,共同探索提升 Agent 后训练数据利用效率和训练效果的新路径。

与传统模型依赖公开语料和教科书式“问答”数据不同,NeoHorse 大量引入真实 Agent 任务中的结构化执行轨迹——包括何时搜索、何时调用工具、工具返回什么、下一步如何走、走错了如何回头。这些轨迹记录的并非“题和答案”,而是“做事的过程”。团队利用轨迹数据中隐含的路由难度信号组织课程学习,让模型先接触低难度样本、再逐步过渡到复杂轨迹,并结合策略蒸馏(On-Policy Distillation)纠偏模型自身的真实偏差。

在覆盖 Harness Agent、工具使用、代码和指令遵循的 10 项基准评测中,经过 Agentic Post-Training 的 NeoHorse-1 4B 模型未加权平均分位居同类模型之首,并在五项基准上超过 Qwen3.5-9B 底座模型。提升最为集中的是流程清晰、反馈可观察、结果可验证的任务类型;而 9B 版本在复杂状态维护、长程调试和失败恢复中仍保持明显优势。

基于无问芯穹的底层基础设施和 Infra 优化技术能力,模型 NeoHorse-1 在研发中获得了推理优化、弹性训练系统等有力支持,实现了大量推理(积累轨迹),并显著提升了训练效率及稳定性。面向推理场景,无问芯穹深耕 PD 分离、计算通信重叠、序列并行通信等一系列模型推理优化关键技术,从单点优化走向系统级协同优化,从集群规模优化到跨集群优化,过去一年已实现推理成本下降 10 倍,未来仍有 10 倍的下降空间。在模型训练中,无问芯穹通过 DynaTrain 弹性训练系统将传统分布式训练“启动即锁定”的刚性模式改造为可在线增删 GPU、可在线整体迁移的动态训练,在千卡以上规模中将单机故障恢复开销从传统方案的十几分钟压缩至 5 秒以内。NeoHorse-1 的发布也是一次面向 RSI 方向的单轮工程验证:Agent 执行轨迹,评测暴露能力短板,训练选择随之调整,模型完成更新并重新返回 Harness。

依托多元异构、软硬协同、自主式 AI 等核心技术优势,无问芯穹实现了对前沿大模型稳定高效训练的系统级支持。面向 Agentic AI 时代,无问芯穹已推出 Agentic Infra 产品与服务体系。该体系立足基础设施,向下汇聚能源与芯片,向上支撑模型与应用,不仅提升底层资源向 AI 生产力转化的规模与效率,更以基础设施智能体蜂群赋能资源规模扩展、Token 生产效率提升,并支持 Agentic AI 的持续进化。目前,无问芯穹正服务千余家 AI 企业与科研机构,覆盖大模型开发与运行全生命周期,持续输出高质量、大规模、高效率的 AI 生产力。