![]()
导语
当大模型从“被调用的工具”变成“自己跑循环的系统”,一个关键问题随之浮现:当模型开始知道自己是什么、正在做什么,评测与监督的可靠性还成立吗?自主性、觉知与自我进化这三条线索,在安全上指向同一个困境——系统开始建模自身,而人类的验证回路可能已跟不上它的迭代速率。
本期读书会为自指与AI读书会第2期,李筱健老师将围绕大模型智能体的觉知、自我进化与AI安全展开分享,介绍AwarenessBench的设计与发现,自演化在模型、记忆、工具、工作流四条路径上"跑偏"的风险,最终落脚于评测失效、思维链可监督性等安全挑战与应对方向。
为系统梳理自指与AI领域的最新进展,北京师范大学系统科学学院教授、集智俱乐部创始人张江老师联合清华大学人工智能学院博士生李筱健共同发起,组织对该主题感兴趣的研究者与探索者共同研读前沿文献、交流研究思路。读书会将于2026年9月5日起每周六下午14:00-16:00线上开展,持续约10周,包含主讲分享与讨论交流,并提供会后视频回放,诚邀相关领域研究者及跨学科兴趣者参与。
报告简介
大模型正在从"被调用的工具"变成"自己跑循环的系统":智能体在长时程任务中持续维持目标,模型在受控干预下能部分报告自身内部状态,而自演化智能体已开始改写自己的记忆、工具与工作流。自主性、觉知、自我进化这三条线索通常被分开讨论,但它们在安全上指向同一个问题——当系统开始建模自己,评测与监督的有效性就不再是给定的前提。
本报告梳理这三个方向的前沿进展,并把落点放在它们与 AI 安全的耦合上。在觉知一侧,我们介绍AwarenessBench,并将其与情境觉知、评测觉知及表征注入类内省实验并置,说明"模型知道自己是什么、正处在什么情境中"这件事如何直接削弱静态评测的效度。在自我进化一侧,我们讨论从Misevolution 等工作揭示的反面证据:自演化沿模型、记忆、工具、工作流四条路径都可能"跑偏",出现安全对齐衰减、部署期奖励黑客与不安全工具复用,且并不需要外部攻击者参与。
由此得到本报告的基本判断:觉知既是自我进化的使能条件,也是安全评测的腐蚀剂;风险主要不来自任一单项能力,而来自三个回路同时闭合、而人类的验证回路跟不上迭代速率。报告最后讨论几个可操作的方向:抗觉知的评测设计、面向演化过程而非静态快照的安全评估,以及思维链可监督性这一正在出现且脆弱的窗口。
分享大纲
从工具到主体:智能体自主性的涌现与度量
觉知的分层:情境觉知、评测觉知与功能性内省
AwarenessBench:设计、发现与启示
自我进化:现有AI自进化系统的主要技术路线
演化会跑偏:Misevolution 与自演化的四条风险路径
三者与 AI 安全的耦合:评测失效、可监督性与展望
核心概念
自主性、情境觉知与评测觉知、功能性内省、自我进化、错误演化(misevolution)、涌现风险、思维链可监督性、AI 对齐与安全
主讲人介绍
主讲人:李筱健,清华⼤学⼈⼯智能博⼠生,方寸跃迁创始人兼CEO,UC Berkeley硕⼠,美国MATS访问学者,师从交叉信息研究院副院长徐葳教授,在AI安全领域发表多篇⼀作论⽂,成果口头报告于ACL、IDAIS、智源⼤会,并与图灵奖得主Yoshua Bengio等⼈共同发布《全球⼈⼯智能安全研究重点新加坡共识》。
参考文献
Shao, S. et al. Your Agent May Misevolve: Emergent Risks in Self-evolving LLM Agents. arXiv:2509.26354, 2025; ICLR 2026.
Zhang, J., Hu, S., Lu, C., Lange, R., Clune, J. Darwin Gödel Machine. arXiv:2505.22954, 2025; ICLR 2026.
Schmidhuber, J. Gödel Machines. arXiv:cs/0309048, 2003.
Lindsey, J. Emergent Introspective Awareness in LLMs. Transformer Circuits Thread, 2025.
Binder, F. J. et al. Looking Inward: LMs Can Learn About Themselves by Introspection. arXiv:2410.13787, 2024.
Laine, R. et al. Me, Myself, and AI: The Situational Awareness Dataset (SAD). NeurIPS D&B, 2024.
Berglund, L. et al. Taken Out of Context. arXiv:2309.00667, 2023.
Kadavath, S. et al. Language Models (Mostly) Know What They Know. arXiv:2207.05221, 2022.
Greenblatt, R. et al. Alignment Faking in Large Language Models. arXiv:2412.14093, 2024.
Hubinger, E. et al. Sleeper Agents. arXiv:2401.05566, 2024.
Meinke, A. et al. Frontier Models Are Capable of In-Context Scheming. arXiv:2412.04984, 2024.
Korbak, T. et al. Chain of Thought Monitorability. arXiv:2507.11473, 2025.
Baker, B. et al. Monitoring Reasoning Models for Misbehavior. arXiv:2503.11926, 2025.
Kwa, T. et al. Measuring AI Ability to Complete Long Tasks. METR, arXiv:2503.14499, 2025.
Fang, J. et al. A Comprehensive Survey of Self-Evolving AI Agents. arXiv:2508.07407, 2025.
活动预告
⏰ 时间:2026年9月12日(周六)14:00-16:00
线上:腾讯会议
直播:微信视频号 + 集智俱乐部B站号同步放送
感兴趣的朋友请扫码报名加入读书会,报名后可进入学员群参与交流讨论。期待与你共探自指与AI的深层连接。
直播信息
报名读书会:「自指与AI」
北京师范大学系统科学学院教授、集智俱乐部创始人张江老师联合清华大学人工智能学院博士生李筱健共同发起,组织对该主题感兴趣的研究者与探索者共同研读前沿文献、交流研究思路。
读书会自2026年8月29日起,每周六下午14:00-16:00线上开展,预计持续8-10周,包含主讲分享与讨论交流,并提供会后视频回放,诚邀相关领域研究者及跨学科兴趣者参与。
扫描海报中二维码报名参加读书会
![]()
报名方式:
第一步:微信扫码填写报名信息。
第二步:填写信息后,付费报名。如需用支付宝支付,请在PC端进入读书会页面报名支付:
第三步:添加运营助理微信,拉入对应主题的读书会社区(微信群)。
PS:
我们鼓励围绕复杂系统、人工智能及相关具体问题的深入探讨。为保证讨论质量,请避免发表脱离本期读书会主题、缺乏实证基础或过于空泛的哲学思辨类内容。
若讨论内容明显偏离主题,经主持人提醒后仍未调整,为维护整体学习环境,我们将不得不将该成员请出讨论群,并根据其实际参与进度,对未参与部分按比例办理退费。
感谢您的理解与配合,让我们共同营造一个专注、深入、有收获的共学空间。
加入社区后可获得的资源
完整权限包括:线上问答、录播回看、资料共享、社群交流、信息同步、共创任务获取积分等。
![]()
特色退费与激励机制
我们提供以下两种途径,让您的投入获得实际回馈:
任务达标退费路径
认领并合格完成任意两期字幕任务,即可退还全额报名费,并额外获得集智专属周边奖励。
运营成长激励路径
合格完成一个字幕任务后,可申请成为运营助理。在读书会项目顺利结项后,将退还学费。表现优异者,还有机会获得额外的奖学金。
1.「自指与AI」读书会推荐阅读材料
扫描下方二维码可跳转至集智斑图网站阅读文章:「自指与AI:从大模型自我改进到意识研究」读书会推荐阅读材料。
2.往期公众号相关内容推荐
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.