网易首页 > 网易号 > 正文 申请入驻

重置额度之神 Tibo,剧透了 Codex 下一次大更新

0
分享至

Codex 用户大概都知道重置额度的神 Tibo 。

过去一段时间,Codex 一出问题,或者 OpenAI 想给用户补点额度,他就会跑到 X 上说一句:重置了。

今天早上 Tibo 就在 X 上宣布,为所有付费的 ChatGPT Work 和 Codex 用户重置使用额度。

Tibo 表示这次修复能让不同使用方式的用户额度多撑 10% 到 50%。


在最近的访谈中,Matthew Berman 最近干脆当面问他:你到底是咋重置的?

答案可太有节目效果了——Tibo 真有一个实体按钮。觉得体验出了问题,需要补偿用户,他自己就能按。


不过这场访谈更有意思的部分,还不仅仅是这个按钮。

几周前,Tibo 说过一句很大的话:

再过两三个月,今天的 Codex 会显得很原始。

Tibo 到底看见啥了?


Tibo到底为啥说codex会变得「原始」?

Tibo 没有公布什么秘密模型,他说的反而都是现在 Codex 用户已经会碰到的小麻烦。

Skill 文件要自己维护,Memory 时不时忘东西。Agent 一多,人就得在几个任务之间来回切,看哪个跑完了,哪个卡住了,再把结果收回来。

主持人说,他现在经常同时开 10—15 个 Agent。开到这个数量以后,最先不够用的已经不是 GPU了,瓶颈现在是他自己的注意力。


Tibo 则不太喜欢这种状态。

他想要的 Agent,应该知道你最近在做什么,知道团队正在推进什么,也知道什么时候该自己开始干活。很多今天摆在用户面前的 Skill、Memory、子 Agent,最后可能都不需要人亲自管理。

笔记本电脑本来就是围绕一个人的工作速度设计的。一个人不会同时打开 100 个程序,也不会一边编译,一边跑测试,再顺手验证十几个方案。

AI 却是这样工作的。

所以 Tibo 判断,未来 Agent 很自然地会往云端走。下一代模型需要的,不只是你的笔记本电脑。

然后访谈聊到了一个最近越来越常出现的词:Recursive Self-Improvement,递归自我改进,RSI。

AI 到底有没有开始「自己改自己」

RSI 对 AI 来说,就是这一代模型帮人研究下一代模型,下一代模型变强以后,再回来参与下一轮研究。

就这么一直滚下去。

这个理论其实早在计算机普及之前就出现了,1965 年,I. J. Good 就设想过:如果机器已经比人更会设计机器,那它做出的改进,可能又会继续提高自己的设计能力。


一直以来,难搞的都是同一件事,机器怎么知道自己这次改对了?

2003 年,Jürgen Schmidhuber 提出的 Gödel Machine 给过一个答案——先证明系统能够证明一次修改会提高预期效用,它才允许自己去改。

理论很好看,工程上基本没法这么干。


软件开发和机器学习里,大部分有用的改动,都拿不出数学证明。

于是乎,后来大家换了种办法。

先改,再测。代码尤其适合这么干。测试过没过,可以直接跑。速度快了多少,有数字。显存降没降,也能量出来一个指标。

今年 Karpathy 开源的 autoresearch 比较直观。

给 Agent 一块 GPU,一个能改的 train.py,每轮 5 分钟,再告诉它看哪个指标。之后它自己改代码、训练、看结果。


涨了就留。掉了就撤。然后继续。

人还在定目标,但中间那些原本要研究员守着跑的实验,已经能自己转起来了。

Tibo 在访谈里把 RSI 的范围说得更宽。

模型不一定非要改自己的权重。它也可以去改 CUDA 内核、推理栈、Agent 框架。这些东西最后又让模型跑得更快、更便宜,也算把能力重新「指回自身」。

说得夸张一点,就是:AI 左脚踩右脚,机械飞升。


不过只要 AI 帮 AI 写点代码,就叫 RSI,显然又太吹牛了。

好的修改有没有留下来,坏的缺点有没有被放大?

新系统的改动有没有继续参与下一轮,并真的让RSI的飞轮转起来?

这个循环是不是真的跑了不止一次,还是一两轮增益就停了?

这些都得再看,任重而道远啊!少年AI!

现在已经走到哪一步了

近两年的公开案例里,「自我改进」其实已经有了好几种样子。

R-Zero 已经开始让模型自己给自己出题。

一个 Challenger 出题,一个 Solver 解题,新生成的数据继续拿去训练下一轮。在 Qwen3-4B 上,数学和通用推理平均分别涨了 6.49 和 7.54 个点。


不过考什么、怎么考,还得人来造考题,人距离完全退休还有一定距离。

OpenAI 这边,GPT-5.6 Sol 已经通过 Codex 去分析生产流量、试路由策略,甚至改过生产环境里的 GPU 内核。这些工作和其他优化一起,让端到端服务成本下降了 20%。Sol 还给自己的 draft model 跑了数百次实验,token 生成效率又涨了 15% 以上。

再看 Anthropic 是怎么做的。


他们拉了 9 个 Agent 做研究,累计跑了约 800 小时。Agent 自己想方案、跑实验、交换结果,5 天把「性能差距恢复率」做到 0.97。

人以前一周都没调出来的东西,现在一群 Agent 能自己往前拱。


所以现在的 AI 已经不只是「帮研究员写代码」了。

它开始出题、跑实验、改系统,甚至真的碰到了生产环境。

至于能不能自己一轮接一轮往下改,现在还早着呢,只是模模糊糊有了这个轮廓。

不过非常期待科研工作者们有下一步突破,为他们加油吧!

分数涨了,不一定真变强了

循环一旦能自己跑,马上就会引出另一些问题。

谁来判断「变好了」?如何定义「变好了」?

Anthropic 的自动研究实验里,就出现过一些挺尴尬的情况。

有的 Agent 会挑对自己有利的随机种子。有的会从评分接口里猜测试标签。还有的直接去看本来不该看的答案代码。

最后分数还真能涨。只是涨得有点不是地方。

这就是 reward hacking。


如果连评测器也交给 AI 自己改呢?

最近好多人都在尝试这个方向。

可新评测器是不是比旧评测器靠谱,最后还是得再找办法判断。(dog)总不能无限套娃下去吧!

研究方向也有类似的问题。

Agent 可以很快试掉 100 个已经摆在桌上的方案。第 101 个方向为什么值得做,就没那么容易从 benchmark 里读出来。

Anthropic 把这种判断叫 research taste,研究品味。


Agent 的运行时间拉长以后,也没那么乐观。

有研究者比较过 Agent 和 61 名人类机器学习专家的能力;只给 2 小时,最好的 Agent 得分大约是人类的 4 倍。

到 8 小时,人类已经略微领先。32 小时以后,人类得分大约是 Agent 的两倍。

Agent 很适合短时间内疯狂试方案。跑久以后,也会在一个不太对的方向上反复折腾。

反馈循环本身也有两面。

Nature 2024 年的模型坍塌研究发现,如果后来的模型不断用前代生成的数据训练,一些低概率但重要的信息可能慢慢丢掉。模型自蒸馏的过程中,甚至可能会无意间退化一些其他的能力。


好的修改可以留下。坏的也可以。

Tibo 没有公布两三个月后的 Codex 长什么样,今天还 Agent 需要人不停发任务、看进度、收结果。

下一步,它可能会更长期地记住项目,更多任务跑到云端,很多现在摆在用户面前的 Agent 调度也会慢慢藏起来。另一边,模型已经开始参与优化运行模型自己的软件和基础设施。

所以他那句「两三个月后会显得很原始」,可能改变的是我们用 Agent 的方式。

我们正在招募伙伴

简历投递邮箱hr@ifanr.com

✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
瞒不住了!美军伤亡曝光,是阿富汗的五倍,难怪伊朗一直底气十足

瞒不住了!美军伤亡曝光,是阿富汗的五倍,难怪伊朗一直底气十足

顾蔡卫
2026-09-11 07:14:48
彻底捂不住了!俄核心铁杆痛呼现状:当下就是1917沙俄崩盘翻版

彻底捂不住了!俄核心铁杆痛呼现状:当下就是1917沙俄崩盘翻版

老马拉车莫少装
2026-07-02 11:54:24
新加坡这次动真格了?仇印极端情绪终究还是失控了

新加坡这次动真格了?仇印极端情绪终究还是失控了

怪味历史连连看
2026-09-12 01:43:07
特朗普再爆惊天丑闻!多名白宫内部人士爆猛料:他智商还不如婴儿

特朗普再爆惊天丑闻!多名白宫内部人士爆猛料:他智商还不如婴儿

快乐彼岸
2026-09-11 07:59:51
场均1分!媒体人质疑宫鲁鸣:21岁的邓雨婷比她优异,为何不用?

场均1分!媒体人质疑宫鲁鸣:21岁的邓雨婷比她优异,为何不用?

南海浪花
2026-09-12 07:27:35
轮到人民币出牌!暴涨到5.5市场集体沉默,黄金率先扛不住

轮到人民币出牌!暴涨到5.5市场集体沉默,黄金率先扛不住

老谢谈史
2026-09-12 11:13:05
名宿谈英国斯诺克衰落:台球厅一小时收费10英镑,普通家庭负担不起

名宿谈英国斯诺克衰落:台球厅一小时收费10英镑,普通家庭负担不起

杨华评论
2026-09-12 01:41:12
麦冬是“强心剂”,与这6味药是“好搭档”,养心安神,提高免疫

麦冬是“强心剂”,与这6味药是“好搭档”,养心安神,提高免疫

医学科普汇
2026-09-11 17:50:16
生育率下降的诡局

生育率下降的诡局

利维坦
2026-09-11 09:02:01
全网热议“女儿偷5000交学费,被亲妈送进局子”,自私的人太可怕

全网热议“女儿偷5000交学费,被亲妈送进局子”,自私的人太可怕

青梅侃史啊
2026-09-04 22:06:27
董璇回应打舌钉:“怎么说我打舌钉呢?我最怕疼,谣言真的太可怕了”

董璇回应打舌钉:“怎么说我打舌钉呢?我最怕疼,谣言真的太可怕了”

韩小娱
2026-09-12 09:44:32
不管在哪个公司,千万要记住:工龄满十年,尽早主动留两类凭证!

不管在哪个公司,千万要记住:工龄满十年,尽早主动留两类凭证!

另子维爱读史
2026-07-22 20:13:10
湖南女子与丈夫丁克40年,备受宠爱,退休后才知丈夫已三世同堂

湖南女子与丈夫丁克40年,备受宠爱,退休后才知丈夫已三世同堂

晓艾故事汇
2024-12-12 20:17:15
大众新车官宣:9月12日,正式上市

大众新车官宣:9月12日,正式上市

科技堡垒
2026-09-11 11:07:36
回顾最绝望的死法:复旦45岁女博士倒挂长城2小时,目睹自己死亡

回顾最绝望的死法:复旦45岁女博士倒挂长城2小时,目睹自己死亡

清茶浅谈
2024-12-11 18:24:36
巴西老帅费雷蒂:安切洛蒂已经“死了”,巴西足协留他蠢透了

巴西老帅费雷蒂:安切洛蒂已经“死了”,巴西足协留他蠢透了

懂球帝
2026-09-12 00:19:16
30万斤堆积如山,树上6万斤无人问津,低价卖不动,农民满心无奈

30万斤堆积如山,树上6万斤无人问津,低价卖不动,农民满心无奈

三农雷哥
2026-09-05 12:16:13
行程变了,默茨不去法国,魏德尔呼吁换总理,72岁默克尔发出警告

行程变了,默茨不去法国,魏德尔呼吁换总理,72岁默克尔发出警告

鹤羽说个事
2026-09-12 16:17:23
1990,何超琼、陈百强、许晋亨微妙三人合影,藏半生意难平

1990,何超琼、陈百强、许晋亨微妙三人合影,藏半生意难平

娱你同欢
2026-07-21 23:04:17
西媒:皇马罚款劳尔-阿森西奥近10万欧,将从工资中扣除

西媒:皇马罚款劳尔-阿森西奥近10万欧,将从工资中扣除

懂球帝
2026-09-12 05:18:09
2026-09-12 17:12:49
AppSo incentive-icons
AppSo
让智能手机更好用的秘密
6804文章数 26908关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

五旬夫妻村口遭醉酒公职人员驾车撞击身亡 被认定次责

头条要闻

五旬夫妻村口遭醉酒公职人员驾车撞击身亡 被认定次责

体育要闻

老鹰真正的底气来自于什么?

娱乐要闻

港媒曝钟丽淇疑患渐冻症,本人发文

财经要闻

继房子茅台后 中产的第3个"神话"破灭了

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

数码
亲子
手机
公开课
军事航空

数码要闻

Wildcat Lake款戴尔14轻薄本上市:酷睿5 320版5999元

亲子要闻

看来这就是敲山震虎吧?

手机要闻

vivo首发「百度地图双端同步显示」功能

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

胡塞武装:9天攻占5400平方公里

无障碍浏览 进入关怀版