![]()
训练集之外的世界,比训练集本身复杂得多。
作者丨马晓宁
编辑丨岑 峰
人工智能过去几年的快速发展,很大程度上建立在规模之上。
更多的数据、更大的模型、更充足的算力,让机器在图像、语言、代码和复杂推理任务上不断刷新能力边界。但真实世界很少像训练环境那样完备:专业数据昂贵而稀缺,模型需要运行在受限的硬件上,任务和工具不断变化,长时间交互中的反馈并不总是及时,而当智能系统进入医疗、工程、机器人和自动驾驶等领域时,一个在测试集上表现优异的模型,也未必能够从容应对那些从未见过的情形。
于是,“泛化”重新成为一个值得追问的问题。
它不只是从一个数据集迁移到另一个数据集,也不只是某个 benchmark 上的一项指标。更实际的问题是:当标签变少、算力受限、任务发生变化,甚至训练时默认成立的条件在现实中不再成立时,人工智能还能否把已经学会的东西带到新的问题中?
![]()
2026 年 8 月,第四届International Workshop on Generalizing from Limited Resources in the Open World(GLOW 2026)在德国不来梅举行,并作为 IJCAI-ECAI 2026 的专题 Workshop 汇聚来自不同研究方向的学者。会议由北京航空航天大学刘祥龙、马宇晴、龚睿昊、郭晋阳,中关村实验室赵晓薇,香港中文大学李思民,以及北京人形机器人创新中心刘宁共同组织。来自不同高校和研究机构的学者围绕有限资源条件下的学习与开放世界泛化展开交流,从未标注数据、大模型压缩、领域任务、大模型评测、智能体学习、类脑架构、手术机器人与自主系统安全等不同视角,共同讨论人工智能如何跨越训练环境的边界,走向更加复杂而真实的开放世界。
这些报告并不试图给“泛化”下一个统一的定义。恰恰相反,它们展示了同一个问题进入不同场景之后,会呈现出怎样不同的面貌。
01
标签之外,数据还藏着多少信息?
对于许多机器学习任务而言,开放世界遇到的第一个障碍并不是没有数据,而是没有足够好的标签。
湖南大学副教授姜阳邦彦在报告 “Towards Reliable Learning with Unlabeled Data: Understanding and Exploiting Hidden Information” 中,把目光投向了大量容易获得、却缺少显式监督的未标注数据。
在医疗、法律等专业领域,高质量标注依赖专家知识,获得过程昂贵且缓慢;与之形成鲜明对比的是,大量原始数据已经存在。问题因此从“如何获得更多标签”变成了另一个方向:没有标签的数据,究竟还能告诉我们什么?
姜阳邦彦将其中的信息归纳为三个方面:结构规律、分布统计和语义不变性。即便没有类别名称,样本之间的邻近关系、聚类结构和多视角之间的一致性,仍然能够反映潜在的数据结构;未标注数据的混合分布本身携带着类别组成信息;而当样本经历不改变其语义的扰动时,模型判断也应保持相对稳定。
围绕这三类信息,报告形成了“发现、重构、正则化”的思路:从未标注数据中发现可靠结构,根据统计关系重构学习目标,再利用语义一致性约束模型。
但“能够利用未标注数据”并不等于“学习过程天然可靠”。以正例—未标注学习为例,即使理论上能够由混合分布得到与监督学习等价的风险形式,灵活的深度模型仍可能在训练中发生过拟合,使预测类别分布逐渐偏离真实先验,最终带来性能下降。因此,报告进一步讨论标签分布对齐,通过约束预测分布,使这种由未标注数据得到的监督更加稳定。
这场报告所讨论的泛化,并不是“给模型更多东西”,而是在问一个更加基础的问题:
当显式监督不足时,我们能否读懂数据本身?
在开放世界里,未知从来不会提前带着标签出现。能够从结构、分布和语义中发现隐藏的监督,也许正是模型摆脱对完备训练集依赖的第一步。
02
模型不能无限变大,
能力该留下多少?
数据是一种资源,算力同样如此。
当大模型不断增长,一个在服务器上表现出色的模型,如何进入显存更小、功耗更低的设备,成为开放世界部署面临的另一道门槛。
来自瑞士苏黎世联邦理工学院的博士后研究员秦浩桐以 “Extreme Quantization for Efficient LLMs — Towards Advanced Edge AI” 为题,介绍了团队在大语言模型极低比特量化上的系列研究。
量化并不陌生。困难出现在精度继续向下压缩的时候。
4-bit 之后再向 2-bit、甚至 1-bit 推进,少量重要参数的表示误差便可能迅速放大,模型能力也随之下降。因此,极低比特量化真正需要回答的,不再只是“怎样把数字表示得更短”,而是在有限的表示空间里,哪些信息不能丢?
BiLLM 根据 Hessian 敏感度区分显著与非显著权重,并针对不同权重采用差异化的二值表示。在无需原始训练数据、也无需重新训练模型的条件下,模型权重可以被压缩至约 1.08-bit。
进一步的研究发现,那些真正影响模型表现的重要权重并非随机散布,而是受到激活异常值影响,较稳定地集中在某些通道和权重组中。SliM-LLM 因此采用组间混合精度与组内显著性校准,把有限的表示能力更多留给真正重要的部分。
一个只能存在于高端服务器里的模型,它能够到达的世界天然有限。量化所做的,是尝试让已有能力跨过硬件边界,走向个人设备、机器人以及更多边缘场景。
在这个过程中,一个越来越清晰的原则浮现出来:资源有限时,重要的不是平均地保留一切,而是知道什么值得被保留。
03
少一些反复尝试,
能不能依然把任务做好?
加州大学圣巴巴拉分校助理教授董镇的报告同样从计算效率出发,却把问题进一步带到了跨领域任务中的执行方式。
报告首先介绍了 OSAQ。低比特权重量化中,极少数异常大的权重可能拉伸整个数值范围,使绝大多数普通权重只能挤在有限的量化区间里。比特越低,这个问题越明显。
与需要在相邻层之间进行补偿的缩放、旋转方法不同,OSAQ 寻找 Hessian 中的低曲率方向,在尽量不改变原任务损失的情况下,对当前层权重进行加性修正,把尖锐的异常峰值压回更适合量化的范围。整个过程发生在部署之前,不要求额外训练,也不会给解码阶段增加新的计算模块。
但报告更有意思的转折出现在后半部分。
董镇提出了一个看似简单的问题:
所有专业任务,都需要不断探索吗?
桥梁修复设计这样的开放式工程问题,可能存在多种合理方案,新的观察会改变判断,比较与迭代自然有意义。
但修改技术图纸中的字体、表格或矢量对象时,具体对象和参数可能不断变化,背后的工作流程却常常高度稳定。倘若每完成一个小步骤,系统都重新观察、推理、确认一次,“谨慎”本身就会变成成本。
围绕这类任务,报告介绍了DrafterBench。它从真实工程图纸修改记录中总结高频模式,通过不同对象和操作类型构建了 1,920 个任务,并配套 46 个可执行工具。
DrafterBench 链接:https://github.com/eason-li-ais/drafterbench
它关注的不只是“最后有没有改对”。
一个模型完全可能得到视觉上相同的文件,却走了一条破坏原始结构的错误执行路径。因此,DrafterBench 同时检查最终修改是否正确,以及工具、参数、顺序和控制流程是否可靠。
结果显示,领先模型已经能够在单次响应中完成相当一部分结构化工作流,但距离完全可靠仍然存在明显距离。尤其值得注意的是,仅仅改变语言表达风格带来的影响相对有限,真正明显破坏完整执行能力的是模糊要求和信息缺失。
这使“泛化”多了一层很实际的含义。
它不是让模型面对任何任务都不断增加思考,而是让它知道:什么时候可以沿着已有规律继续向前,什么时候又必须停下来重新判断。
04
当我们说一个模型“更强”,
究竟是指什么?
但这里还有一个容易被忽视的问题。
如果不同模型都在不断提升能力,我们又凭什么判断一个模型真的变得更好了?
特别是在开放世界里,一个 benchmark 上更高的分数,是否真的意味着模型面对没有见过的任务、不同领域和现实扰动时,也拥有更可靠的表现?
中国电子技术标准化研究院工程师彭鹤麒在 “On the Evaluation of Large-scale Models” 报告中,将讨论带回了人工智能评测本身。
随着大模型从语言模型继续走向多模态、全模态和智能体,评测对象正在发生变化,模型需要面对的任务也从通用能力不断延伸到不同专业领域。报告提出,今天的大模型评测已经不能只回答“准确率是多少”,还需要同时回答一系列更加接近实际使用的问题:
模型能否泛化到未见过的任务和领域?面对输入变化时是否仍然稳定?生成内容是否可信?推理过程是否可靠?
这恰恰触及开放世界泛化中一个常常被忽略的前提:如果测量本身并不可靠,我们就很难知道所谓的“泛化能力”究竟是真实存在,还是恰好适应了某一套测试题。
报告将现有评测问题概括为一个三角:“评什么、怎么评、在哪里评”。一方面,评测对象已经由 LLM 延伸到多模态和 Agent,任务也越来越丰富;另一方面,随着模型规模增加,完整运行大量 benchmark 的显存和推理成本迅速增长,评测本身也开始成为一件资源密集型工作。
更关键的问题出现在 benchmark 本身。
现有大模型测试集有时会给出不一致的排行榜,面对顶尖模型时又缺乏足够的区分度。一套分数看似精确的测试,并不天然意味着它真正测出了模型之间的能力差异。
为此,报告介绍了 PSN-IRT,将心理测量学中的项目反应理论引入大模型 benchmark 分析。
与只给整个数据集计算一个总体指标不同,PSN-IRT进一步观察每一道题。它通过伪孪生网络分别建模模型和试题,并利用项目反应理论估计模型潜在能力,以及试题的区分度、难度、猜测率和可作答性等属性。
这让 benchmark 本身也成为可以被“诊断”的对象。
基于 12 款模型和多套通用 benchmark 的分析,报告发现,现有测试集很难在多种测量属性上同时表现良好,一些 benchmark 对最先进模型的难度上限不足,大量题目已经趋于饱和;此外,部分题目的异常高猜测率提示可能存在数据污染风险,而一些科学类 benchmark 中较低的可作答性则暴露出题目设计问题。
评测同样需要考虑效率。
既然不同试题提供的信息量并不相同,就没有必要为了“全面”而机械地做完所有题目。报告利用 Fisher 信息选择更具测量价值的试题,实验显示,由此得到的模型排序能够更好地与参考评价保持一致。 讲者提供的总结进一步指出,仅使用 1000 道经过筛选的试题,就能够得到更加贴近人类偏好的评测结果。
在方法研究之外,报告还介绍了中国电子技术标准化研究院建设的“求索”人工智能国家标准评测基准体系和LMBench 大模型测试基准。LMBench 覆盖 30 项理解类任务和 16 项生成类任务,并从准确性、交互性、可靠性和适用性四个维度设置 140 项通用评测指标。
因此,这场报告与前面几场形成了一个很自然的转折。
我们当然需要让模型在更少数据、更少算力和更复杂任务中表现得更好,但在此之前,还需要确保手中的尺子足够可靠。
开放世界中的泛化,不仅需要被实现,也需要被正确地测量。
一个好的 benchmark 不应该只是越来越长的题库,而应该真正知道哪些问题能够区分能力、哪些测试已经失去信息,以及怎样用有限的评测成本看见模型真实的边界。
05
一次成功的学习迭代中,
究竟是哪一步起了作用?
如果说评测告诉我们模型究竟走到了哪里,那么当智能体开始真正与环境持续交互时,问题又回到了“它应该怎样继续学习”。
新加坡南洋理工大学人工智能系主任安波在 “Agentic Reinforcement Learning” 报告中,将强化学习带入 LLM Agent 的多轮交互场景。
![]()
相比单轮问答,智能体真正进入 Web、软件、工具和具身环境之后,面对的是连续决策:观察环境、调用工具、接收结果、调整计划,再进入下一步。报告指出,当前 Agentic RL 仍然面临探索不足、信用分配困难和 rollout 数据利用不足等问题。
其中最棘手的一点,是奖励来得太晚。
一条任务轨迹可能持续几十步。最终成功或失败,并不能直接告诉模型,中间哪一步是转折点,哪一步其实多余,哪一步虽然看起来合理,却埋下了后续失败的原因。
传统 GRPO 主要提供轨迹级反馈,很难区分单个步骤对最终结果的贡献。
GiGPO 因此把优势估计从整条轨迹进一步延伸到步骤层面。它寻找不同轨迹中的共同状态,比较相同状态下的不同行动,由此得到更细粒度的相对反馈;这一过程仍然建立在已有 rollout 上,不需要为了估计每一步价值再额外生成新的交互。
与此同时,长交互还会带来另一个朴素的问题:历史越来越长。
verl-agent 允许更灵活地管理记忆,并把每一步响应独立处理,从而避免上下文随着交互轮数持续膨胀,使数十步长时程任务的训练更加可扩展。
开放世界很少一次把答案告诉智能体。
更多时候,它只给出零碎、延迟甚至模糊的反馈。如何从有限的试错中分辨真正有价值的经验,正是智能体从“会回答”走向“会行动”需要跨过的一道门槛。
06
记住什么,忘掉什么,也是一种智能
当一个智能体开始长期行动,资源问题又悄悄发生了变化。
它不再只是缺少训练样本或显存,也会开始面对和人相似的问题:信息太多了,什么应该记住?什么可以忘掉?什么经验值得下一次继续使用?
新加坡南洋理工大学计算机学院教授刘杨在 “From Human Intelligence to Machine Intelligence: a Brain-Inspired Agent Computation Architecture” 中,从人类认知系统重新审视机器智能的组织方式。
报告首先讨论了大语言模型赖以成功的分布式语义。模型能够从语言共现关系中形成强大的统计表示,但这种“统计结构的内化”并不天然等于世界模型或因果理解。
于是,问题从“模型知道多少”转向了“知识如何构成智能”。
报告沿着事实知识、概念知识、程序知识和元认知知识展开,并进一步把这种分层思考延伸到智能体:感知、记忆、规划、自我监控与执行,并不是一个单一模块能够包办的过程。
在类脑智能体架构中,高层感知与规划、记忆和元认知,与机器人中的语义理解、经验调用、计划验证相联系;而小脑和脊髓所承担的运动协调、程序记忆与适应,则对应更细粒度的动作控制和技能优化。
报告中的多存储记忆框架进一步区分了感觉记忆、工作记忆和长期记忆。实验结果显示,随着工作记忆、情景经验、规则与预期逐步加入,智能体在不同任务上的平均成功率持续提升。
这场报告并没有把“类脑”简单理解为复制脑区。
它所提出的更深层问题是:面对一个无法提前穷举的世界,机器是否也需要形成自己的记忆层次、知识结构和自我调节机制?
开放世界永远会带来训练阶段没有见过的信息。此时,真正重要的可能不只是把上下文窗口做得更长,而是让系统学会在有限容量里组织过去、理解现在,并为下一次行动留下真正有用的经验。
07
每一分钟的数据都很昂贵
在医疗场景,有限资源不再只是一个抽象概念。
一段高质量的专家手术视频,本身就是昂贵的数据。
香港中文大学助理研究教授徐梦雅在 “Surgical Skill Learning from Expert Data” 中讨论的,正是如何让这些珍贵的数据产生尽可能多的学习价值。
报告没有把目标定义成“看懂一段手术视频”,而是构造了一条逐步向行动靠近的能力链:
发生了什么?手术进行到了哪里?下一步应该做什么?应该在哪里做?最终,机器人能否真正学会执行?
这也是报告从动作识别、过程理解、行动规划、区域定位一直推进到机器人策略学习的整体脉络。
其长期目标并不是把医生排除在回路之外,而是监督式自主:机器人承担部分操作,医生仍然保持监督和必要时的接管。
在数据层面,研究首先尝试把异构手术数据组织成能够同时支持识别、定位、推理与规划的结构化监督。
Basic Surgical Actions 则进一步寻找不同手术之间能够共享的“动作词汇”。相比过于具体的机器人轨迹,基础动作更容易跨设备和场景迁移;相比过于粗粒度的手术阶段,它又能够真实描述医生正在做什么。
在此基础上,Surgical Action Planning 从识别过去进一步转向预测未来:模型结合此前的动作历史和自然语言目标,判断下一步可能的合理操作;在多个器械协作的场景中,这种规划又继续扩展为多主体之间的协同。
最终,研究进一步连接操作意图、目标区域与机器人策略。
但报告同样为这种泛化划出了边界:未来自主手术仍需建立在真实专家示范、物理验证、不确定性意识以及医生监督之上。
在医疗这样的开放环境里,“泛化”从来不能只意味着模型在新样本上得到更高分数。
它最终需要回答的是:从有限的专家经验中学到的东西,能不能被带到不同患者、不同阶段和不断变化的真实操作环境里,同时仍然保持可解释和可控。
08
进入开放环境后,
实验室内的假设还成立吗?
泛化的最后一道考验,往往发生在模型真正走出实验室的时候。
独立研究者汪宁非以 “Vulnerability for Safety-Critical Autonomous Systems from a Practicality Perspective” 为题,把视线投向自动驾驶和无人机等安全关键自主系统。
自动驾驶依靠摄像头、LiDAR、雷达、GPS 等不同传感器观察环境。感知结果随后进入预测、规划和控制,因此,一旦感知模块对现实世界产生错误理解,后面的决策链条都会受到影响。
过去许多对抗攻击研究集中于单一AI模块。
但汪宁非提出了两个更加贴近现实的问题:组件级漏洞真的能够传播成系统级风险吗?在学术原型上成立的攻击,又能否进入真实物理环境?
多传感器融合原本被认为能够提高安全性。其直觉很自然:如果摄像头被欺骗,LiDAR 仍然可能看到障碍物;如果一个传感器出错,另一个可以进行交叉验证。
但这依赖一个前提——攻击者无法同时影响所有感知来源。
报告介绍的研究正是在检验这个前提。
研究者设计了可以通过 3D 打印制造的对抗性三维物体。改变物体形状,会同时改变 LiDAR 点云中的几何分布和相机图像中的视觉信息,因此,一个现实中的实体就有机会同时影响两套感知来源。
报告展示了缩小比例实验、真实车辆实验和自动驾驶仿真,并通过可微渲染与优化,把攻击目标反向作用到三维物体形状,同时考虑现实制造和物理环境中的稳定性。
第二个案例则转向无人机自主目标跟踪。研究通过改变跟踪结果,使无人机错误估计人与自身之间的距离,进而产生错误运动。
这些工作最后落在两个从“实验室”走向“现实”的缺口上:一个是 AI component 到完整 system,另一个是 academic prototype 到 real-world system。
这也让 GLOW 所讨论的“开放世界”有了最具体的一层含义。
真实世界不会主动遵守训练时的假设。
一个真正能够进入开放环境的系统,不仅需要在未知条件下继续工作,也要知道原先赖以成立的安全边界什么时候已经失效。
泛化,发生在训练集之外。
从未标注数据中的隐藏结构,到极低比特条件下对模型能力的保留;从专业工作流中的可靠执行,到重新审视我们用于衡量模型的那把“尺子”;从智能体如何利用长轨迹中的稀疏反馈,到类脑记忆与认知组织;从有限专家示范中的技能学习,再到真实物理世界中对安全假设的重新检验——
GLOW 2026 上的这些报告并没有给出一条统一的“开放世界泛化算法”。
它们更像是从不同方向照亮了同一个事实:
训练集之外的世界,比训练集本身复杂得多。
在这里,标签可能不存在,算力可能不够,任务可能改变,反馈可能迟到,专家数据可能昂贵;甚至连我们用来衡量能力的 benchmark,也需要不断检查它是否仍然足够困难、可靠和有效。系统进入物理世界之后,环境还可能主动挑战训练阶段默认成立的安全假设。
因此,开放世界中的泛化,也许不应该只被理解成一种模型能力,而更接近一整套面对未知的能力:
在信息不足时仍能学习,在资源有限时懂得取舍,在任务变化时能够迁移,在有限评测成本下看清自己的真实能力,在长期交互中积累经验,也在走入现实之后,对自身边界保持足够清醒。
当人工智能开始真正走出训练集,泛化才不再只是论文中的一项指标,而成为智能能否抵达现实的那一步。
IJCAI 2026 要来了,你还在单打独斗?
为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 现场探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
进群传送门:扫码进群或添加微信Qvv0909777,备注:IJCAI+ 单位/学校+姓名+方向。
搞科研/搞技术,信息差很重要。
来,一起快人一步!
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.