大模型跑分高,就代表能力真的强吗?AllenAI 团队提出了一种名为 BenchMIRT 的新方法,专门用来审计大模型基准测试——它能在提示词(prompt)级别拆解测试项,把混在一起的信号(比如安全性和通用推理能力)分离开来。
传统基准测试往往给出一个笼统的总分,但分数背后可能混杂了多种能力维度。BenchMIRT 基于多维项目反应理论(MIRT),逐条分析每个测试问题,搞清楚它到底在考察模型的哪项能力。
![]()
为什么这很重要?
如果基准测试里安全类问题占比过高,模型总分可能被拉低,但这并不代表它的推理能力差。BenchMIRT 能帮你识别出这类干扰因素,让评测结果更接近真实水平。
简单说,这套方法让研究者能看清:分数涨了,到底是能力真涨了,还是测试题本身有偏向。对于依赖跑分选模型的人来说,这算是个避坑工具。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.