一篇论文把12个模型、3679个问题固定下来,只调整提示词格式、选项顺序、打分方式这些常规评测设置,结果排名出现大幅波动。
同一模型得分跨度惊人
![]()
gemma4-31b的得分在31%到89%之间变化。12个模型里有4个至少在一种有效设置下排到过第一。
差距主要来自评测设置
相邻模型之间平均95.7%的差距,来自那些评测设置一改就会翻转答案的题目。最大的不稳定来源是打分方式——到底是生成答案,还是选最高似然选项。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.