网易首页 > 网易号 > 正文 申请入驻

有头有脸的大模型公司,集体搞起「匿名公测」

0
分享至


渠道选对了,匿名本身就成了一种营销。

作者|连冉

编辑|郑玄

最近,海外开发者圈又被一个没有名字的模型刷屏了。

8 月 20 日,OpenRouter 上多了一个叫 Ox Alpha 的模型,100 万 token 上下文、支持图片和视频输入、能调用工具、免费。随后,它被接进 OpenCode、Hermes 等编程 Agent。有人拿它修代码,有人用它跑软件工程基准,还有人盯着 tokenizer 和报错信息,试图猜出它到底是谁家的。

目前,Ox Alpha 的身份还没有得到官方确认。社区最流行的猜测是,它与智谱 GLM-5.x 系列关系很近;依据是 tokenizer、推理模式报错和部分输出习惯的相似性。但这还只是技术分析,智谱官方目前还没有认领。

从 Ox Alpha 爆火,可以看到一个越来越常见的出海打法:模型先匿名上线,让海外开发者替它做第一轮测试、传播和身份鉴定。

01

从 HappyHorse 到 Ox Alpha

Ox Alpha 并不是第一个蒙着脸跑出来的模型。


往前翻四个月,阿里的 HappyHorse(欢乐马)也是这个路数—— 没有发布会,没有公司名,直接空降到 AI 评测平台 Artificial Analysis 的 Video Arena 榜单上,一度把字节 Seedance 2.0 和快手可灵 3.0 挤到身后,登顶榜一。讨论热度起来几天后,阿里确认,HappyHorse 来自 ATH 创新团队。

今年以来,OpenRouter 上接连出现了一批「Alpha」模型。

2 月,Pony Alpha 上线,后来被 OpenRouter 标注为 GLM-5 的早期测试版本;3 月,Hunter Alpha 被小米认领为 MiMo-V2-Pro 的早期测试版本;4 月,Elephant Alpha 上线后揭晓为蚂蚁 Inclusion AI 的 Ling-2.6-flash。Pony Alpha、Hunter Alpha、Elephant Alpha 的模型页上,如今都留下了这段「前身」记录。

匿名测试本来就是 OpenRouter 长期存在的机制,OpenAI、xAI、NVIDIA 等团队都曾用过类似方式。只是从 HappyHorse、Pony Alpha 到 Ox Alpha,中国团队越来越熟练地把海外开发者平台当成新品的第一站。

这背后的逻辑不难理解。

大模型出海,厂商真正要争取的并不只是一次新闻曝光,而是进入开发者的日常工作。DeepSeek 和 Qwen 已经在海外社区积累了不少认知,但更多中国团队仍处在「听过,但没用过」的阶段。直接挂着公司名发布,开发者未必会专门去试;一个神秘代号,加上免费、长上下文、Agent 这些关键词,更容易让人点开。

它们也选对了地方。

HappyHorse 去的是视频模型盲测榜单,排名变动本身就会成为话题;Ox Alpha 进入的是 OpenRouter 和 OpenCode。前者是开发者选模型、比价格的入口,后者直接连着编程 Agent。用户不需要下载新软件,也不用重新学习一套工作方式,换个模型就能让它开始读代码、跑任务。

这和过去的发布会逻辑不太一样。以前,厂商先告诉市场「我很强」,再等待用户来验证;现在,模型先被扔进开发者的工作流,用户用几天就会给出答案。

渠道选对了,匿名本身就成了一种营销。

02

匿名上线,开发者一边测能力,

一边给它「验明正身」

Ox Alpha 上线后,海外社区很快出现了两种不太一样的声音。

一边是惊喜。社区流传的一组 DeepSWE 测试中,Ox Alpha 在 10 个软件工程任务里通过了约 8 个,成绩高过同场测试的几款知名模型。对一款刚上线、连开发者是谁都不知道的模型来说,这个结果足够吸引注意力。

但另一边,质疑也来得很快。10 个任务只是很小的样本,每多过或少过一道题,分数都会变化 10 个百分点。后来出现的更大样本社区复测,结果回落到约 63%。这个数字同样不是官方审计榜单,只能作为参考。它至少说明,匿名模型上线初期,最容易被放大的往往是小样本里的惊喜。

还有研究者拿 Ox Alpha 跑更偏抽象推理的 INDUCTION 基准,得到的结论也没那么乐观:它的成绩落后于 GPT-5.6 Luna 和 DeepSeek V4 Pro,仅略高于 Gemini 3.7 Flash;为了得到 87 个可评估结果,测试者调用了 551 次 API,期间多次遇到空回答和接口错误。他自己也无法确认,这些问题究竟主要来自模型,还是来自 OpenRouter 的接入链路。

这些结果并不必然互相矛盾。今天的 Agent 模型,很难只靠一张 benchmark 表判断好坏,模型、推理档位、工具调用、网关和具体任务,都会改变最终结果。它答对一道题,和它能不能在一个真实代码库里连续工作两个小时,是两件不同的事。开发者真正关心的是,它能不能理解项目结构,工具调用会不会出错,任务做到一半会不会停住,失败后能不能自己恢复,上下文拉长后还记不记得最初目标。

开发者也在试图找出它是谁。由于厂商没有公开说明,社区只能从模型的行为里找线索:一句话被切成多少 token,错误参数会返回什么提示,把 temperature 调到 0 后会怎样组织答案,甚至中文提示词下会不会露出某种习惯。

目前最流行的猜测是,Ox Alpha 与智谱 Z.ai 的 GLM-5.x 系列关系很近。社区发现,它的 tokenizer、推理档位报错,以及部分固定条件下的输出习惯,都和 GLM-5.3 很接近;Ox Alpha 又支持图片和视频输入,而公开的 GLM-5.3 主打文本能力,这也让不少人猜测它可能是一个尚未发布的多模态变体。

这个过程本身说明了匿名发布的一个特点:匿名模型一上线,开发者社区很快就会接手后面的工作:有人跑测试,有人拆参数,有人翻报错,有人顺着 token 计数一路猜到模型可能出自哪家。

开发者一边当公测用户,一边也做了媒体、分析师和测试工程师的活。

03

匿名能带来真实反馈,

也把更多问题留给了用户

如果模型一开始就挂着 OpenAI、Google、阿里或智谱的名字,用户很难完全摆脱预期。有人会因为品牌愿意多给它几次机会,也有人会因为对某家公司的印象,连试都不想试。匿名以后,开发者先看到的是结果:代码写得怎么样,工具会不会调错,长任务能不能做完,价格值不值得。

OpenRouter 联合创始人 Alex Atallah 此前回顾 Quasar Alpha 的匿名测试时提到,平台和模型团队想看的,是用户在不知道模型开发者是谁的情况下,会怎样使用和评价它。对模型团队来说,这能减少品牌带来的预设,也能更快拿到真实反馈。


这也是为什么匿名模型总能迅速调动开发者社区。

厂商放出一个代号,用户就会开始跑 benchmark、接入 Agent、对比输出,甚至研究 tokenizer 和报错信息。HappyHorse、Pony Alpha 到 Ox Alpha,都是同一个过程:模型还没正式发布,社区已经替它完成了一轮能力测试、一轮技术分析和一轮口碑传播。

从厂商角度看,这笔账很好算。实验室里的 benchmark 能告诉团队模型「会不会做题」,开发者则会告诉团队模型「能不能干活」。它在真实代码库里会不会卡住,工具调用会不会出错,长上下文拉长以后还记不记得目标,高峰期服务稳不稳定——这些问题,只有真实用户拿项目去撞,才能撞出来。

匿名测试还有一个更直接的好处:免费期里留下的使用数据,会帮助厂商判断模型应该卖给谁、该怎么定价、哪些能力值得继续投入。对还在找产品定位的新模型来说,这比提前写好一套发布会话术更有价值。

但这场盲测并不完全对等。

厂商和平台知道模型是谁、服务跑在哪里、哪些信息会被记录;用户拿到的往往只有一个代号和一段有限的说明。Reddit 上就有开发者提到,匿名模型很难进入严肃的企业评估流程:公司内部的 benchmark、代码和业务数据都涉及合规,等走完审批,模型可能已经下线了。对个人开发者来说,这是一份免费的惊喜;对企业来说,更像一份没有署名、也没有完整说明书的试用品。

Ox Alpha 把这个问题放大得更明显。OpenRouter 的页面写明,提示词和输出会由上游提供商保留,但不会用于训练;OpenCode 的相关说明则强调零数据留存。两种说法并不完全一致。对只是试玩的用户,这可能只是条款差异;对准备上传代码和业务文档的团队来说,它直接决定了能不能接入。

还有一个容易被忽略的问题:真实公测测出来的,从来不只是一款模型的能力。

研究者 Serafim Batzoglou 在 INDUCTION 基准上测试 Ox Alpha 时,遇到了大量空回答和 API 错误。为了获得 87 个可评估结果,他一共调用了 551 次 API。他的困惑很有代表性:问题究竟出在模型,还是出在 OpenRouter 的接入链路?对最终用户来说,这个问题其实没有那么重要——模型能不能稳定工作,本来就是产品能力的一部分。

匿名发布,确实给了模型一个摆脱品牌滤镜的机会,也让厂商能更早看到真实世界的反馈。但厂商拿到真实数据的同时,用户也承担了更多判断成本:要自己猜身份,自己判断能力,自己核对数据政策,还要自己承担服务不稳定的风险。

*头图来源:oxalpha.com

本文为极客公园原创文章,转载请联系极客君微信 geekparkGO


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中国女篮75-72淘汰波多黎各女篮,晋级女篮世界杯八强,将PK世界第3

中国女篮75-72淘汰波多黎各女篮,晋级女篮世界杯八强,将PK世界第3

侧身凌空斩
2026-09-10 01:27:02
人形机器人IPO变天!宇树科技成科技股大笑话,监管层终于出手了

人形机器人IPO变天!宇树科技成科技股大笑话,监管层终于出手了

故事终将光明磊落
2026-09-09 21:22:52
220万买下临街旺铺,有房本却无权锁门;法院判决:需给后方两铺留通道留门

220万买下临街旺铺,有房本却无权锁门;法院判决:需给后方两铺留通道留门

大风新闻
2026-09-09 19:55:08
长沙小孩摸女人后续:正脸曝光,网红账号被扒,黑历史一件接一件

长沙小孩摸女人后续:正脸曝光,网红账号被扒,黑历史一件接一件

皮蛋儿电影
2026-09-08 14:19:33
“摸臀” 女网红社死,安徽母校评论区被冲烂,留学梦可能有变数

“摸臀” 女网红社死,安徽母校评论区被冲烂,留学梦可能有变数

四斤
2026-09-09 15:22:29
长沙男童“摸臀”事件:当事女主要的不是对不起,而是一场盛大的发布会

长沙男童“摸臀”事件:当事女主要的不是对不起,而是一场盛大的发布会

News脑洞
2026-09-09 15:46:08
朝鲜宣布:人民的美梦和理想全面实现!

朝鲜宣布:人民的美梦和理想全面实现!

IN朝鲜
2026-09-09 13:33:10
女篮头号功臣!韩旭21+11连4场两双 末节14分大爆发主宰胜利

女篮头号功臣!韩旭21+11连4场两双 末节14分大爆发主宰胜利

醉卧浮生
2026-09-10 01:32:09
无缘首进美网四强!郑钦文1-2终结7连胜 莱巴金娜首登世界第一

无缘首进美网四强!郑钦文1-2终结7连胜 莱巴金娜首登世界第一

醉卧浮生
2026-09-10 01:57:47
坚决支持中国政府的严正声明,越南占领的中国岛礁全部归还

坚决支持中国政府的严正声明,越南占领的中国岛礁全部归还

叶老四
2026-09-09 13:55:36
美网凌晨战报:女单爆冷!萨巴伦卡18连胜,中国金花惨败止步八强

美网凌晨战报:女单爆冷!萨巴伦卡18连胜,中国金花惨败止步八强

寒士之言本尊
2026-09-09 18:43:01
苹果iPhone 18 Pro灵动岛新功能演示视频曝光

苹果iPhone 18 Pro灵动岛新功能演示视频曝光

IT之家
2026-09-09 21:17:36
苹果iOS 27升级灵动岛,并行追踪导航/外卖/赛事等3项实时活动

苹果iOS 27升级灵动岛,并行追踪导航/外卖/赛事等3项实时活动

IT之家
2026-09-10 02:03:11
父亲猝然离世爱车下落不明,17岁女儿含泪急寻“豫VMX951”下落,郑州兄弟俩雨夜驱车一小时帮找到,当事人回应

父亲猝然离世爱车下落不明,17岁女儿含泪急寻“豫VMX951”下落,郑州兄弟俩雨夜驱车一小时帮找到,当事人回应

极目新闻
2026-09-09 19:17:48
56岁“韩国李小冉”又火了:这逆天细腰大长腿,P都不敢这么P!

56岁“韩国李小冉”又火了:这逆天细腰大长腿,P都不敢这么P!

英国那些事儿
2026-09-09 00:45:25
济南一男子为缴百万元保费背上贷款,实名举报太平人寿,监管部门查实:存在销售误导、给予合同外利益行为

济南一男子为缴百万元保费背上贷款,实名举报太平人寿,监管部门查实:存在销售误导、给予合同外利益行为

大风新闻
2026-09-09 18:53:29
如果长沙男童“摸臀”事件发生在美国,会是什么结果?

如果长沙男童“摸臀”事件发生在美国,会是什么结果?

西虹市闲话
2026-09-09 16:34:34
田里打农药遇眼镜蛇,男子对着蛇嘴猛喷农药,第二天一幕让人害怕

田里打农药遇眼镜蛇,男子对着蛇嘴猛喷农药,第二天一幕让人害怕

三农雷哥
2026-09-09 17:57:31
苹果发布iPhone 18 Pro / Max

苹果发布iPhone 18 Pro / Max

IT之家
2026-09-10 01:22:12
56比94惨败38分无缘八强!中国女篮压力大了:日韩出局他们成独苗

56比94惨败38分无缘八强!中国女篮压力大了:日韩出局他们成独苗

篮球快餐车
2026-09-09 04:57:55
2026-09-10 02:19:00
极客公园
极客公园
让最棒的创新成为头条
12493文章数 78940关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

男子资助女生5年后停止 遭质问"快打过来 不然曝光你"

头条要闻

男子资助女生5年后停止 遭质问"快打过来 不然曝光你"

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

知情人士证实DeepSeek备战科创板IPO

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

时尚
本地
家居
亲子
公开课

女人不管多大,都可以看看这些“条纹T恤”,非常减龄又简约

本地新闻

宁波,中国制造的隐藏大佬

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

当妈妈生病时

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版