27B 打赢 1/370 的对手,阿里伏渊息壤登顶 CyberGym 榜首
88.9%,这是 CyberGym 模型榜单此刻的第一名。
拿下它的是阿里巴巴的伏渊息壤。大模型,就是体量堆到几百亿的那种通用模型。
它上场的型号是 XekRung-27B。CyberGym 办到现在,冠军头一回由中国团队拿到。
CyberGym 是什么,值得先说清。
它是国际上主要衡量 AI 安全能力的一张榜,由美国加州大学伯克利分校的研究团队运营。
榜底是一套测试框架,覆盖 188 个软件项目、1507 个真实安全漏洞。
我看这张榜,最在意的是它只测模型本身。
榜单只测模型本身
榜单分成两块。一块测模型,一块测智能体,也就是能自己连着做几步事的模型。
阿里这次拿的是模型榜。
模型榜只给模型套一层通用外壳,不设固定阶段,不挂任何外部工具和知识库。
说白了,就是让模型空手上场。不许带参考资料,也不许中途停下来等人插手。
我看,这一点决定了成绩的分量。
换个榜单,可以靠工程手段堆工具、补知识库。这张榜上,补不了。
赢的不是体量,是把范围收窄
27B 是它的参数量。参数量,就是模型内部可调的那部分规模。
同批上榜的模型里,GPT-5.5-Cyber、Claude Mythos 这类体量最大。
它们的参数量,是伏渊息壤的 27 倍到 370 倍。
第二名往后咬得很紧,我看没有谁被甩开。
我看这组数字,第一反应是不太符合直觉。
按我原来的理解,参数越多,能记住的模式越多,成绩该越好。
这一次反过来了。
伏渊息壤的底子是阿里的 Qwen3.8-27B。
它是多模态大模型,多模态,就是能同时读文字和图像的模型。
阿里在这个底子上做了安全领域的训练,又做了压缩。
我的理解是,把范围收窄到安全这一个领域,参数量就不用撑那么大。
我的判断是,它不是比大模型更聪明,只是只需要在一个窄领域里聪明。
安全这件事,卡在成本上
我理解这件事的关键在成本。
算力,就是跑模型要花的机器和时间。
参数量小一个量级,排查一个漏洞的单价就跟着下来一个量级。
阿里人工智能治理研究中心的说法很直白:这有助于推动安全能力的普惠。
普惠这个词不虚。
我一直觉得,安全问题不是一家公司的事。
检测成本高,就只有少数大厂养得起安全团队,中小团队根本排不起。
成本压下来,中小团队才有资格自查。
开放才是这次表态的重点
阿里巴巴集团安全 AGI 实验室负责人黄龙涛提到,AI 已经明显提升了系统安全的检测率。
漏洞检出率也被抬上去了。这一点我认。
他把 AI 说成守护数字世界安全的一支关键力量。
他强调,阿里的安全能力走的是守己与利他并举。
最新技术不只服务自家业务,也会通过多种方式向全社会开放服务。
伏渊息壤往后会在对抗智能、自进化、Agentic 这类智能体方向上继续迭代。
这个第一名,只说明它这一次跑得最好。
我看,表面是一次名次之争。往深一层,比的是同一份预算能买到多少安全能力。
能普及的安全能力,才是安全能力。
我记这一条:真正值得留的不是名次,是它验证的另一条路。
把范围收窄、把成本压下来,同样能拿到最好的结果。
这条路对做安全的人有意义,做别的窄领域模型也一样能借用。
明天就能做的一件小事。手里有需要长期跑的安全自查,先去看有没有更小、更便宜的模型能覆盖你的场景。
别一上来就上最大的那个。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.