7 月 27 日,OSWorld 权威榜单完成更新,国内技术团队自研的实在 Agent 以 90.2%的总成功率、325.59 分总成绩,包揽总榜与 Agentic Framework 分榜双冠,刷新全球 Computer-Use Agent 公开评测最高纪录,成为业内首个突破 90%成功率的桌面操作智能体,将全球同类技术的能力边界推向全新高度。
对于开发者与技术从业者而言,OSWorld 是衡量智能体实景落地能力的黄金标尺。区别于仅能模拟简单网页交互的轻量化评测基准,OSWorld 基于 Ubuntu 真实操作系统,搭建 361 项全场景实战任务,全程机器无主观评分,精准考核智能体的环境感知、长链路规划、多软件协同、底层系统操作等核心硬核能力。
自 2024 年上线以来,OSWorld 始终是全球顶级模型能力校验的核心标准,GPT、Gemini、Claude 等旗舰模型的技术迭代成果,均以该榜单数据为核心佐证。
复盘行业两年迭代曲线,全球计算机使用智能体完成了指数级进化:从 2024 年的 12.2%基础成功率,到 2025 年突破 72.6%超越人类基线,再到 2026 年 5 月 83.6%的行业高点,行业技术迭代速度持续攀升。而实在 Agent 此次 90.2%的突破,打破了行业存在的技术瓶颈。
从技术拆解维度来看,实在 Agent 团队首次打榜即领先,核心源于三大硬核能力。
在最考验长链路逻辑的跨应用协同场景中,面对 93 项多软件连续流转的复杂任务,可自主完成浏览器下载、文档编辑、截图存档、邮件发送的全流程操作;在 GIMP 像素级图像处理场景中,攻克非标准浮动面板、自定义工具栏的识别难题,26 项任务完成 24 项,成功率达 92.3%;在零容错的系统底层运维场景中,实现 24 项任务满分通关,文件权限修改、进程管理、命令行操作全程零失误,展现出底层执行稳定性。
业内开发者共识显示,大模型底座能力已进入同质化阶段,Harness 工程体系成为智能体能力分层的核心关键。Stanford、清华等研究数据表明,相同模型底座下,优质的 Harness 架构优化可带来 6-10 个百分点的性能提升,复杂场景下优化迭代增益最高可达 17 个百分点。
实在 Agent 的领先,正是八年工程化深耕的结果,而非单次模型调优的偶然突破。自 2018 年成立以来,实在智能始终聚焦自动化落地,持续打磨适配真实桌面环境的多模态 Harness 体系,形成“API 可行则调用 API,无 API 则 GUI 可视化操作”的类人执行逻辑。同时依托海量企业级真实场景数据,完成了千万级异常场景的迭代优化,解决了实验室模型“跑分强、落地弱”的行业通病,让智能体具备适配复杂真实环境的实战能力。
跑分突破是技术里程碑,产业落地才是终极目标。当前 AI 智能体竞争已从“参数竞赛”转向“工程落地竞赛”,实在智能已明确下一阶段技术迭代方向:通过人机协同熔断机制,将智能体可靠性从 90.2%提升至工业级 99.99%;优化动态环境抗干扰能力,适配弹窗、版本更新、网络波动等真实办公场景;迭代端云混合调度架构,降低推理成本与延迟,搭配全链路可审计合规体系,让高分智能体真正走进企业生产场景,成为开发者与企业的高效生产力工具。





