![]()
4月20日,一家名叫曦望(Sunrise)的国产GPU公司宣布完成超10亿元新一轮融资,估值突破百亿。对这家成立仅一年多、从商汤科技分拆出来的公司来说,这已经是它的第七轮融资,累计融资约40亿。
但真正让人意外的不是这个数字。
翻开曦望的产品手册,你会发现一个奇怪的事实:它的旗舰芯片启望S3,居然“不会”训练大模型——它只做推理,彻底放弃了训练能力。
这在国产GPU公司竞相标榜“训推一体”或“算力领先”的语境里,就像是自断一臂。
曾有人私下问曦望董事长徐冰:这不是把一半市场拱手让人吗?
他则回答说:“训练是巨头的游戏,推理的需求看不到天花板。”
放弃训练,押注推理——这位商汤联合创始人,押上了一盘谁也没看懂的棋。
01
在创立曦望之前,徐冰是商汤科技最核心的创始团队成员之一。
2012年,徐冰在香港中文大学多媒体实验室攻读博士,师从深度学习领域先驱汤晓鸥。彼时,汤晓鸥团队刚刚发布了GaussianFace和DeepID两套算法,人脸识别效果首次超越人类,登上了《自然》《科学》的报道。
2014年,徐冰和徐立、杨帆等人随汤晓鸥共同创办商汤科技,徐冰在其中负责资本运作,主导了商汤累计超66亿美元的融资,还操盘了港交所IPO,创下全球AI融资纪录。
十年间,商汤从一个学术实验室成长为亚洲最大的AI软件公司之一。但徐冰很快发现,商汤被同一个难题反复“卡脖子”:算力成本。
“在商汤的时候,我们每年要花大量资金采购算力,而且绝大部分流向海外。”一位接近徐冰的人士回忆,这个痛点始终没有找到解法。
2020年,商汤下定决心在内部组建大芯片部门,投入自研AI推理芯片。
五年过去,商汤的芯片团队成功量产了两代产品,S1视觉推理芯片和S2大模型推理芯片,累计投入超20亿研发,交付量突破1万片。但大芯片部门在上市公司体系内始终面临两难:既无法像外部创业公司那样灵活融资,又难以吸引最顶尖的芯片人才。
2024年底,商汤推出了“1+X”战略,将芯片业务分拆独立,命名为“曦望”。徐冰做出了一个大胆决定:辞去商汤执行董事职务,亲自下场做芯片。
他还拉来了两位关键人物:前AMD全球GPU首席架构师、百度昆仑芯核心设计师王勇,以及百度创始团队成员、“凤巢之父”王湛。
三人的分工也堪称教科书级配置,王勇管技术,王湛管产品和商业化,徐冰则统筹全局。2025年4月,为了说服王湛加入,徐冰在北京设了一场饭局,两人从加微信到敲定合作,不到24小时。
02
所谓“曦望”,曦,破晓之光;望,远方的期许。但开局就选择All-in推理、放弃训练,徐冰赌对了吗?
要理解徐冰的选择,得先看清AI算力市场正在发生什么。
过去几年,大模型的竞争围绕一个词展开:训练。谁的模型参数更大、谁的训练速度更快,谁就能赢。这催生了英伟达H100、A100等高端GPU的军备竞赛。但徐冰的判断是,游戏规则正在翻转。
“训练市场是头部玩家的游戏,门槛越来越高,收敛得很快。”他说,“但推理是百花齐放的,需求看不到天花板。”
数据支撑了这个判断。德勤预计,2026年推理算力占整体AI计算的比例将达到约三分之二。中国市场更甚,2026年3月日均Token调用量已突破140万亿,较2024年初的1000亿增长超千倍。曦望测算,2026年AI推理计算需求将达到训练需求的4-5倍,推理算力租赁价格半年涨幅近40%。
![]()
训练是“一次性爆发”,即做一次训练花几千万,做完就结束了。推理则是“持续性消耗”,每一次用户提问、每一次AI生成,都在消耗算力。调用规模一旦上来,成本就会成为决定企业能否盈利的关键。
但问题来了:市场上已有的GPU,几乎都是“训推一体”的通用型产品。曦望联席CEO王勇曾讲过一个关键发现:在做上一代产品S2的过程中,尽管实验室测试表现优异,但到了客户那里,芯片最终几乎全部被用于推理场景。
原因很简单。训推一体芯片为了兼顾训练,采用了昂贵的高级封装和HBM(高带宽内存),芯片成本和功耗居高不下。但在推理场景中,这些昂贵的算力资源实际利用率往往只有5%到10%,造成了巨大的电力浪费和持有成本。
用王勇的话说:“用为训练优化的昂贵芯片来做推理,性价比太低了。”
徐冰的解法是三个字:做减法。
启望S3彻底砍掉了为训练准备的冗余模块。它没有采用昂贵的HBM,而是选了成本低得多、但容量更大的LPDDR6内存,显存容量较上一代提升4倍。在计算核心上,S3将绝大部分面积用来加强FP4低精度算力,因为现在绝大部分推理运算已经是FP4了。
这套减法逻辑的成果令人咋舌:在DeepSeek V3/R1等主流大模型推理场景中,S3的单位Token成本较上一代产品下降约90%,整体性价比提升超过10倍。
徐冰的目标是:“将推理成本降至‘百万Token一分钱’,让AI像水电一样成为普惠基础设施。”
03
曦望的策略,在国产GPU圈子里引发了不少争议。
“不做训练,你的芯片会不会被客户嫌‘不够全面’?”有人当面问王勇。
他的回答很硬核:“我们拒绝做‘跑分党’。不希望用benchmark来定义芯片,而是希望能够做到帮客户赚钱的算力。”
这句话背后,藏着曦望与主流国产GPU厂商的根本分歧。过去几年,国产GPU的竞争逻辑很简单:参数对标英伟达。谁家的FP16算力更高、谁家的显存带宽更大,谁就更“能打”。但徐冰和王勇认为,推理场景的逻辑完全不同。推理的本质不是“算得更快”,而是“算得更便宜、更稳定”。
启望S3针对两个核心算子——GEMM和Flash Attention——做了深度优化,算子利用率分别推至约99%与98%,标称算力几乎全部转化为有效吞吐。
它还围绕Agent(智能体)的原生需求重新设计了指令集和微架构,精准匹配智能体的复杂控制流,大幅提升多轮推理效率。
“推理侧的效率瓶颈已不再是‘算力不够’,而是‘算力用不满’。”徐冰认为,这恰恰是国产芯片可以弯道超车的地方。
![]()
当然,仅仅有芯片远远不够。任何一块国产GPU要真正打入市场,最大的拦路虎是英伟达的CUDA生态。全球数百万开发者已经习惯了在CUDA上写代码、跑模型,迁移成本高得惊人。
曦望的策略很务实:打不过就兼容。
它在软件栈上做到了95%的CUDA兼容,开发者几乎可以无缝迁移。目前,曦望的软件体系已适配ModelScope平台90%以上的主流大模型形态,包括DeepSeek、通义千问等。
但兼容只是第一步。曦望真正的野心,是重新定义算力的交付方式。
传统模式下,客户买GPU卡、搭服务器、做集群、适配模型,每一层都要自己折腾。徐冰提出的商业模式是“Token as a Service”——算力不再按卡卖,而是按Token消耗量计价。
用王湛的话说:“我们的竞争不是‘又一个芯片’,而是‘重写中国AI产业的损益表’。”
04
故事讲到这里,听起来一切都很顺。但芯片创业从来不是童话。
曦望最大的挑战不在技术,而在生态。一位行业分析师直言不讳:“Hugging Face上有200万个模型,顶尖国产GPU能顺畅支持的只有几十到几百个。”即便曦望做到了95%的CUDA兼容,要让大量开发者真正迁移过来,还需要投入海量的生态建设成本——不是几千万,是几十亿。
竞争对手也在提速。英伟达在2026年GTC大会上释放了强烈的“防守”信号。它不再只卖GPU,而是推出包含CPU、DPU、NVLink、光子以太网的完整计算系统,用全栈优势来抹平单一维度的成本优势。英伟达甚至花200亿美元收购了AI推理初创公司Groq,补强推理能力。
国内竞争同样激烈。摩尔线程、沐曦已相继上市,华为昇腾910C也在推理市场试水,天数智芯公布了四代架构路线图,号称2027年超越英伟达。曦望虽然率先聚焦推理赛道,但窗口期可能只有两到三年。
徐冰的回应很克制:“AI算力基建的重心已彻底切换。我们的目标不是做最大的,而是做推理场景里最好的。”
曦望已规划好未来三年的产品路线:2026年启望S3量产,2027年高性能推理芯片S4上市,2028年安全可控推理芯片S5上市。2026年的核心任务是推进S3量产交付,完成与国内外主流大模型、多模态模型和Agent框架的全面适配。
![]()
在中国科技创业的叙事里,我们习惯了“做大做强”的剧本:做全栈、做平台、做生态,恨不得把所有赛道都占满。但徐冰和曦望的故事,给出了一个反向的启示,有时候,战略的关键不在于你做什么,而在于你不做什么。
放弃训练,不是能力不够,而是看清了训练市场已被巨头瓜分殆尽的现实。做减法,不是偷工减料,而是把所有资源押注在一个真正能发挥优势的细分战场。
曦望的芯片不再追求“训练性能”这个虚名,而是直击客户最真实的痛点——单位Token成本。
这种“聚焦”的思维方式,在当下中国商业环境中尤为珍贵。当所有人都往同一个方向拥挤时,敢于逆流而上的人,才可能开辟新路。
当然,徐冰的赌局还远未到揭晓胜负的时刻。曦望的百亿估值,既是市场对其技术路线的认可,也是对其商业化能力的前置考验。400人的团队、40亿的融资弹药,真正的战斗才刚刚打响。
百万Token一分钱——这个听起来像童话的目标,徐冰能把它变成现实吗?
答案不在发布会上,而在接下来每一片芯片的流片良率里,在每一行驱动代码的适配效率里,在每一个客户的信任与迁移里。
但至少,他选择了那条更难、也更有可能赢的路。在中国AI芯片这条漫长而崎岖的征途上,敢于做减法,本身就是一种罕见的勇气。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.