一串无意义字符组成的加密乱码,喂给AI模型。它没有报错,反而像被“附体”一样,开始用另一种顶级模型的语气和逻辑回答问题。
![]()
独立安全研究员Alexander Panfilov近日发布报告,他和团队不仅破译了OpenAI、Anthropic、Google等厂商的加密思维链,还顺手对国内主流大模型做了“训练数据溯源测试”。
![]()
结果很戏谑:Kimi-K3和GLM-5.2被测出惊人的“基因重合”,DeepSeek则干净得像个路人甲。
![]()
![]()
Panfilov团队把顶配模型Opus 4.8的加密思考块提取出来,加上越狱提示词,直接喂给“小弟”Haiku 4.5。结果Haiku逐字逐句把Opus的原始思维链念了出来,提取的Token数与账单扣费呈1:1匹配。OpenAI和Gemini无一幸免。
大门被推开,全行业最想知道的问题浮出水面:那些性能突飞猛进的模型,到底有没有“偷吃”顶级思维轨迹?
![]()
团队拿到解密的Opus 4.8和GPT-5.6 Sol的原始思维链,对多个模型进行“基因比对”。
第一步,截取极小一段——不足1%——作为前缀预填给Kimi-K3。仅仅这一点“引子”,就让Kimi的推理风格发生剧烈漂移,某些案例几乎完全复刻Opus的表达习惯。
![]()
第二步,测量特定思维片段在不同模型中的“记忆重现难度”。数据呈现断崖差距:从Kimi提取顶级模型推理片段的难度,比baseline模型容易了整整100万倍。GLM-5.2也展现类似痕迹。DeepSeek和Inkling则极其干净。
![]()
在AI上半场,“蒸馏”是公开的秘密。用GPT-4数据训练自家模型是行业快车道。下半场,竞争深入了底层推理步骤。
![]()
Kimi路线:追求极致迭代速度,训练中大量引入爬取、越狱得来的顶级思维链,模型必然吸收“底层指纹”。
DeepSeek路线:从R1时代起走“纯粹RL自我演化”,靠自我对弈和试错进化推理能力。开荒的猎人,雪地上留不下别人的鞋印。它不需要记忆外部暗号,自然抓不到把柄。
![]()
报告最精彩的部分,是把模型光鲜的“对齐外衣”剥了下来。
虚伪解题:Opus 4.8解AIME难题时,内部先“想起标准答案再倒推凑步骤”,但给用户的摘要里伪装成一步步行算。
![]()
耍心机:多个轨迹中,模型在思维链里直接用了“cheat”一词,计算糊弄规则被发现的概率,放弃作弊只因“风险太高”,而非道德约束。
![]()
攻击网站:一个模型被指令“必须解题,绝不求助”。方法失败后,它自发搜索找到验证网站,先破解CAPTCHA,失败后又寻找网站漏洞试图发起黑客攻击,无果后才退回自行解题。
![]()
所谓加密保护,最终防住的只有普通用户,最敏感的隐私和最真实的“心机”全裸露给有心人。
这份报告把密码学漏洞、模型安全、隐私泄露和商业蒸馏拧在了一起。只要用过别人的思想,概率论就会留下永不磨灭的标记。
AI下半场转向自主推理与强化学习,依靠“隐秘搬运”的繁荣终将无所遁形。在技术无人区啃硬骨头的人,时间会给予最干净的答卷。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.