![]()
人工智能
Simular开发的计算机智能体Sai在OSWorld 2.0基准测试中取得了73%的成功率。该评级基于108项任务的测试集,专门评估日常工作中耗时较长的专业任务——这类任务通常需要有经验的人类工作者花费一个小时以上才能完成。
Simular表示,Sai的这一最优性能使其超越了OpenAI报告的GPT-5.6 Sol(62.57%)和Anthropic报告的Opus 5(70.57%),而实现这一成绩的成本仅为两者的约三分之二。
Sai的设计目标并非为了在行业评测中刷榜,而是专注于解决真实工作场景中的任务,能够在完整的桌面应用和网页上操作、调用API并编写代码。
这款智能体融合了前沿通用模型与专业模型,通过专用接口感知并操作用户的计算机,以公司承诺的"个人和企业均可承受的价格"执行复杂的真实任务。
专为日常必要工作而生的计算机智能体
Simular联合创始人兼CTO杨家晨告诉The New Stack,他认为,为所有人日常必要工作(如招聘外联、发票核验、新闻资讯研究)而设计的计算机智能体,不应该仅仅因为"底层模型是为了解决人类尚未攻克的数学猜想"而变得价格高不可攀。
"后人会觉得现在还有人这样构建模型是件荒唐的事,"杨家晨说,"Sai在OSWorld 2.0上实现的最优性价比,是迈向未来的一步——在那个未来,我们不必为了把工作做好而付出天价。"
Simular于今年3月首次发布Sai。这家总部位于帕洛阿尔托的公司自称是"以研究为导向的智能体创业公司",由前DeepMind科学家李昂(CEO)和杨家晨(CTO)联合创办。
公司采用神经符号方法,即将神经网络灵活的探索能力与符号代码的精确性相结合。这意味着已解决的任务可以被编码为可复用的代码,每次以相同方式执行。其核心逻辑简单而直接:处理第一百张发票的成本不必和处理第一张一样高。
OSWorld 2.0基准测试是什么?
OSWorld 2.0由香港大学HKU NLP小组旗下的可执行语言接地(XLANG)实验室于6月26日发布,并于8月8日更新。与第一版相比,OSWorld 2.0已超越简短的桌面操作评测范畴。Simular提醒大家,其开源智能体Agent S是去年12月首个在OSWorld 1.0上超越人类基准水平的。
针对Sai的测试结果尚未出现在OSWorld 2.0官网排行榜的疑问,Simular解释称:"企业或机构优先在自家网站发布基准测试结果并不罕见(参见Anthropic和OpenAI的做法)。我们正在向OSWorld 2.0排行榜提交结果,同时也在将轨迹数据上传至Hugging Face。"
与OSWorld 1.0不同,OSWorld 2.0的任务计时单位从分钟升级为小时,涵盖了真实工作挑战:跨多个数据源查找与推理(如分散在邮件和报销单中的票据)、响应动态环境变化(如任务执行中途收到一条消息)、精确遵循操作指南(如报销规定),以及排查信息差异(如数据相互矛盾)。
Simular团队认为,OSWorld 2.0目前是业内最严格的开放基准测试,也最能反映真实工作场景。
杨家晨团队解释,Sai之所以能实现更优的性价比,得益于前述的神经符号规划方式。具体而言,Sai平均比纯模型方案少调用约1.5倍的模型接口——它每轮可执行更多操作,并使用Simulang代码(一种用于macOS桌面自动化的Claude Code技能)作为规划和执行较长子任务的符号语言。
Sai如何实现工程效率优化?
在缓存和内存效率方面,Sai通过自适应摘要(一种动态内存管理技术,用于保持模型上下文窗口精简)控制输入规模,并尽量长时间维持固定的提示前缀,减少摘要频率。代码规划还让Sai在整个任务执行过程中,将关键任务信息保存并访问于运行时内存中。
在模型编排方面,Sai会针对界面元素定位、纯推理、结果验证等具体步骤调用专用模型和接口,避免对不需要全部任务上下文的步骤使用高成本模型。
在一项测试中,Sai、Sol和Opus被要求在OSWorld 2.0上玩Chrome小恐龙游戏,并在真实页面上完成目标分数。Sai将这个重复性的实时游戏视为编程问题而非点击问题:它从原始像素中测量地面线、障碍物速度和自身输入延迟,随后编写了一个捕获屏幕、检测障碍物并执行跳跃的控制循环,通过单次调用在虚拟机上运行。
此外,三款智能体还参与了OSWorld 2.0的第28项任务"疫苗预约":根据一封关于所需接种疫苗的邮件、桌面上的接种记录扫描件,以及含有价格、距离和日期限制的预约网站,完成整个预约流程。
开发者如何看待Sai?
机器学习计算机科学家圣地亚哥·瓦尔达拉马是Sai的支持者,他在LinkedIn上写道:"由于Sai运行在完整的桌面环境而非仅限于浏览器或API,它能够处理那些拦截标准自动化操作的应用程序,这开启了大多数智能体无法触及的全新任务类别。"
AI营收系统专家巴尔金德·拉利的评价则更为持平,他表示Sai的表现"与我在构建智能体工作流时的亲身体验相符",但同时提醒道:"演示效果固然亮眼,但真正的可靠性来自安全护栏、可见性和人工介入的检查节点。"
AgenticMode AI创始人贾汉扎伊布·A.持有类似看法。他表示自己在语音智能体上也遇到过相同的可靠性问题——"演示时无懈可击,但在生产环境中遇到没人预料到的边缘案例时却悄无声息地失败了。可观测性才是关键——没有它,你只是在盲目调试。"
智能体领域的实用主义者
Simular坚持其研究立足于具有经济价值的实际工作,而非追求演示效果。公司表示,这意味着团队深刻理解"计算机智能体的完整技术栈",包括模型本身、规划与接地、脚本层、智能体运行的虚拟机以及用户界面。
公司的核心理念是"Sai面向所有人,而非只是实验室成果"——这折射出一批新兴模型的发展方向:专注于可落地、可交付的职场任务,而非参与一场以算力、吞吐量和分析指标为目标的军备竞赛。
Q&A
Q1:Sai智能体在OSWorld 2.0上的成绩如何,与GPT-5.6 Sol和Opus 5相比怎么样?
A:Sai在OSWorld 2.0的108项任务测试中取得了73%的成功率,超过了OpenAI的GPT-5.6 Sol(62.57%)和Anthropic的Opus 5(70.57%),且实现这一成绩的成本仅为两者的约三分之二。
Q2:Sai为什么能以更低成本完成任务?
A:Sai采用了神经符号规划方法,将神经网络的灵活性与符号代码的精确性相结合。已完成的任务可被编码为可复用代码,实现重复执行。此外,Sai通过自适应摘要控制上下文窗口大小,并针对不同子任务调用专用模型,平均比纯模型方案少调用约1.5倍的接口,从而大幅降低成本。
Q3:OSWorld 2.0和OSWorld 1.0有什么区别?
A:OSWorld 2.0由香港大学XLANG实验室推出,相比第一版,它不再评估简短的桌面操作,而是专注于耗时以"小时"计算的复杂真实任务,涵盖跨数据源推理、响应动态环境变化、遵循操作指南及排查信息矛盾等场景,被Simular团队认为是目前业内最贴近真实工作场景的开放基准测试。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.