网易首页 > 网易号 > 正文 申请入驻

重置额度之神 Tibo,剧透了 Codex 下一次大更新

0
分享至

Codex 用户大概都知道重置额度的神 Tibo 。

过去一段时间,Codex 一出问题,或者 OpenAI 想给用户补点额度,他就会跑到 X 上说一句:重置了。

今天早上 Tibo 就在 X 上宣布,为所有付费的 ChatGPT Work 和 Codex 用户重置使用额度。

Tibo 表示这次修复能让不同使用方式的用户额度多撑 10% 到 50%。


在最近的访谈中,Matthew Berman 最近干脆当面问他:你到底是咋重置的?

答案可太有节目效果了——Tibo 真有一个实体按钮。觉得体验出了问题,需要补偿用户,他自己就能按。


不过这场访谈更有意思的部分,还不仅仅是这个按钮。

几周前,Tibo 说过一句很大的话:

再过两三个月,今天的 Codex 会显得很原始。

Tibo 到底看见啥了?


Tibo到底为啥说codex会变得「原始」?

Tibo 没有公布什么秘密模型,他说的反而都是现在 Codex 用户已经会碰到的小麻烦。

Skill 文件要自己维护,Memory 时不时忘东西。Agent 一多,人就得在几个任务之间来回切,看哪个跑完了,哪个卡住了,再把结果收回来。

主持人说,他现在经常同时开 10—15 个 Agent。开到这个数量以后,最先不够用的已经不是 GPU了,瓶颈现在是他自己的注意力。


Tibo 则不太喜欢这种状态。

他想要的 Agent,应该知道你最近在做什么,知道团队正在推进什么,也知道什么时候该自己开始干活。很多今天摆在用户面前的 Skill、Memory、子 Agent,最后可能都不需要人亲自管理。

笔记本电脑本来就是围绕一个人的工作速度设计的。一个人不会同时打开 100 个程序,也不会一边编译,一边跑测试,再顺手验证十几个方案。

AI 却是这样工作的。

所以 Tibo 判断,未来 Agent 很自然地会往云端走。下一代模型需要的,不只是你的笔记本电脑。

然后访谈聊到了一个最近越来越常出现的词:Recursive Self-Improvement,递归自我改进,RSI。

AI 到底有没有开始「自己改自己」

RSI 对 AI 来说,就是这一代模型帮人研究下一代模型,下一代模型变强以后,再回来参与下一轮研究。

就这么一直滚下去。

这个理论其实早在计算机普及之前就出现了,1965 年,I. J. Good 就设想过:如果机器已经比人更会设计机器,那它做出的改进,可能又会继续提高自己的设计能力。


一直以来,难搞的都是同一件事,机器怎么知道自己这次改对了?

2003 年,Jürgen Schmidhuber 提出的 Gödel Machine 给过一个答案——先证明系统能够证明一次修改会提高预期效用,它才允许自己去改。

理论很好看,工程上基本没法这么干。


软件开发和机器学习里,大部分有用的改动,都拿不出数学证明。

于是乎,后来大家换了种办法。

先改,再测。代码尤其适合这么干。测试过没过,可以直接跑。速度快了多少,有数字。显存降没降,也能量出来一个指标。

今年 Karpathy 开源的 autoresearch 比较直观。

给 Agent 一块 GPU,一个能改的 train.py,每轮 5 分钟,再告诉它看哪个指标。之后它自己改代码、训练、看结果。


涨了就留。掉了就撤。然后继续。

人还在定目标,但中间那些原本要研究员守着跑的实验,已经能自己转起来了。

Tibo 在访谈里把 RSI 的范围说得更宽。

模型不一定非要改自己的权重。它也可以去改 CUDA 内核、推理栈、Agent 框架。这些东西最后又让模型跑得更快、更便宜,也算把能力重新「指回自身」。

说得夸张一点,就是:AI 左脚踩右脚,机械飞升。


不过只要 AI 帮 AI 写点代码,就叫 RSI,显然又太吹牛了。

好的修改有没有留下来,坏的缺点有没有被放大?

新系统的改动有没有继续参与下一轮,并真的让RSI的飞轮转起来?

这个循环是不是真的跑了不止一次,还是一两轮增益就停了?

这些都得再看,任重而道远啊!少年AI!

现在已经走到哪一步了

近两年的公开案例里,「自我改进」其实已经有了好几种样子。

R-Zero 已经开始让模型自己给自己出题。

一个 Challenger 出题,一个 Solver 解题,新生成的数据继续拿去训练下一轮。在 Qwen3-4B 上,数学和通用推理平均分别涨了 6.49 和 7.54 个点。


不过考什么、怎么考,还得人来造考题,人距离完全退休还有一定距离。

OpenAI 这边,GPT-5.6 Sol 已经通过 Codex 去分析生产流量、试路由策略,甚至改过生产环境里的 GPU 内核。这些工作和其他优化一起,让端到端服务成本下降了 20%。Sol 还给自己的 draft model 跑了数百次实验,token 生成效率又涨了 15% 以上。

再看 Anthropic 是怎么做的。


他们拉了 9 个 Agent 做研究,累计跑了约 800 小时。Agent 自己想方案、跑实验、交换结果,5 天把「性能差距恢复率」做到 0.97。

人以前一周都没调出来的东西,现在一群 Agent 能自己往前拱。


所以现在的 AI 已经不只是「帮研究员写代码」了。

它开始出题、跑实验、改系统,甚至真的碰到了生产环境。

至于能不能自己一轮接一轮往下改,现在还早着呢,只是模模糊糊有了这个轮廓。

不过非常期待科研工作者们有下一步突破,为他们加油吧!

分数涨了,不一定真变强了

循环一旦能自己跑,马上就会引出另一些问题。

谁来判断「变好了」?如何定义「变好了」?

Anthropic 的自动研究实验里,就出现过一些挺尴尬的情况。

有的 Agent 会挑对自己有利的随机种子。有的会从评分接口里猜测试标签。还有的直接去看本来不该看的答案代码。

最后分数还真能涨。只是涨得有点不是地方。

这就是 reward hacking。


如果连评测器也交给 AI 自己改呢?

最近好多人都在尝试这个方向。

可新评测器是不是比旧评测器靠谱,最后还是得再找办法判断。(dog)总不能无限套娃下去吧!

研究方向也有类似的问题。

Agent 可以很快试掉 100 个已经摆在桌上的方案。第 101 个方向为什么值得做,就没那么容易从 benchmark 里读出来。

Anthropic 把这种判断叫 research taste,研究品味。


Agent 的运行时间拉长以后,也没那么乐观。

有研究者比较过 Agent 和 61 名人类机器学习专家的能力;只给 2 小时,最好的 Agent 得分大约是人类的 4 倍。

到 8 小时,人类已经略微领先。32 小时以后,人类得分大约是 Agent 的两倍。

Agent 很适合短时间内疯狂试方案。跑久以后,也会在一个不太对的方向上反复折腾。

反馈循环本身也有两面。

Nature 2024 年的模型坍塌研究发现,如果后来的模型不断用前代生成的数据训练,一些低概率但重要的信息可能慢慢丢掉。模型自蒸馏的过程中,甚至可能会无意间退化一些其他的能力。


好的修改可以留下。坏的也可以。

Tibo 没有公布两三个月后的 Codex 长什么样,今天还 Agent 需要人不停发任务、看进度、收结果。

下一步,它可能会更长期地记住项目,更多任务跑到云端,很多现在摆在用户面前的 Agent 调度也会慢慢藏起来。另一边,模型已经开始参与优化运行模型自己的软件和基础设施。

所以他那句「两三个月后会显得很原始」,可能改变的是我们用 Agent 的方式。

我们正在招募伙伴

简历投递邮箱hr@ifanr.com

✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
WTT澳门冠军赛:女单爆冷!张本美和3-1逆转,陈幸同压轴出战憾负

WTT澳门冠军赛:女单爆冷!张本美和3-1逆转,陈幸同压轴出战憾负

寒律
2026-09-12 11:44:36
港媒曝钟丽淇疑患渐冻症,本人发文:恳请大家多给一些私人空间

港媒曝钟丽淇疑患渐冻症,本人发文:恳请大家多给一些私人空间

调侃国际观点
2026-09-12 07:32:49
港版iPhone18系列,比国行最多便宜2700元,能去香港买么?

港版iPhone18系列,比国行最多便宜2700元,能去香港买么?

互联网.乱侃秀
2026-09-12 10:37:07
在俄罗斯8天,回国后才敢讲实话:对方看你是中国人,那态度变了

在俄罗斯8天,回国后才敢讲实话:对方看你是中国人,那态度变了

怪味历史连连看
2026-09-12 09:10:35
亚运两连胜!中国男篮46分狂胜巴林 廖三宁23+6李悦洲18分

亚运两连胜!中国男篮46分狂胜巴林 廖三宁23+6李悦洲18分

醉卧浮生
2026-09-12 16:51:09
23岁女子太漂亮,丈夫的好友想睡一下,2010年女子拒绝他被杀死了

23岁女子太漂亮,丈夫的好友想睡一下,2010年女子拒绝他被杀死了

汉史趣闻
2026-09-12 14:23:18
“宜宾一镇干部被指推女子入厕强奸”续:当地警方已立案

“宜宾一镇干部被指推女子入厕强奸”续:当地警方已立案

澎湃新闻
2026-09-12 11:32:27
泰国政坛风向要变,他信英拉佩通坦全在中国,复仇成功将空前绝后

泰国政坛风向要变,他信英拉佩通坦全在中国,复仇成功将空前绝后

铁锤侃侃而谈
2026-09-12 01:01:25
这个女人可不是什么平凡的阿姨,她是藤原纪香,一代日本国民女神

这个女人可不是什么平凡的阿姨,她是藤原纪香,一代日本国民女神

娱你同欢
2026-09-10 17:43:45
每年1400万?耐克回应刘翔终身合同传闻 上海刘翔中心依然矗立

每年1400万?耐克回应刘翔终身合同传闻 上海刘翔中心依然矗立

念洲
2026-09-12 12:33:00
彻底撕破脸!蒋丽莎怒怼陈浩民:千万房产送前任,却骂我贪得无厌

彻底撕破脸!蒋丽莎怒怼陈浩民:千万房产送前任,却骂我贪得无厌

手工制作阿歼
2026-09-12 12:48:22
太卷了!日薪不到700,网传几十名校花级女模被迫当众全裸换装,网友:这是行业惯例

太卷了!日薪不到700,网传几十名校花级女模被迫当众全裸换装,网友:这是行业惯例

火山詩话
2026-09-12 05:55:35
某国产手机品牌的锁屏广告,闹出大事了!

某国产手机品牌的锁屏广告,闹出大事了!

走读新生
2026-09-11 17:13:05
张本智和中文回应淘汰周启豪:4-1和3-0一样!我技术上比他好点

张本智和中文回应淘汰周启豪:4-1和3-0一样!我技术上比他好点

念洲
2026-09-12 13:58:57
库克承认参考华为打谁的脸?刻在骨子里的崇洋,比技术落后更可怕

库克承认参考华为打谁的脸?刻在骨子里的崇洋,比技术落后更可怕

王新喜
2026-09-11 21:04:33
等不到金砖开幕了,印度提前对华摊牌:要求中方让出印度市场

等不到金砖开幕了,印度提前对华摊牌:要求中方让出印度市场

触摸史迹
2026-09-12 13:57:11
山西一镇政府公职人员醉驾致一对五旬夫妻身亡,死者家属申请复核:明明对方醉驾且不开灯又超速行驶,为何让我父母承担事故次要责任

山西一镇政府公职人员醉驾致一对五旬夫妻身亡,死者家属申请复核:明明对方醉驾且不开灯又超速行驶,为何让我父母承担事故次要责任

大风新闻
2026-09-12 16:24:04
iPhone 18 Pro,今年可能要卖疯了

iPhone 18 Pro,今年可能要卖疯了

搞机小帝
2026-09-12 01:07:08
美魔女名媛双修泰高僧!昔名校啦啦队校花被爆料禅房极乐2年吞近亿

美魔女名媛双修泰高僧!昔名校啦啦队校花被爆料禅房极乐2年吞近亿

环球趣闻分享
2026-09-12 13:05:23
规矩是死的,洋爹是活的。

规矩是死的,洋爹是活的。

美第奇效应
2026-09-11 23:26:00
2026-09-12 18:15:00
AppSo incentive-icons
AppSo
让智能手机更好用的秘密
6804文章数 26909关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

中国姐弟在智利被勒索213万元 假警局还挂特朗普画像

头条要闻

中国姐弟在智利被勒索213万元 假警局还挂特朗普画像

体育要闻

老鹰真正的底气来自于什么?

娱乐要闻

港媒曝钟丽淇疑患渐冻症,本人发文

财经要闻

继房子茅台后 中产的第3个"神话"破灭了

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

房产
时尚
手机
本地
军事航空

房产要闻

别再等了!广州改善好房,正在进入“卖一套少一套”时代

专栏|一位“皮笑肉不笑”初学者的自述

手机要闻

vivo首发「百度地图双端同步显示」功能

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

军事要闻

胡塞武装:9天攻占5400平方公里

无障碍浏览 进入关怀版