NotTrack AI
登录 打开聊天

一个分数衡量了什么、没衡量什么

阅读约 2 分钟

一个分数衡量了什么、没衡量什么

基准测试,衡量的是一组固定的任务,用固定的提示词,自动打分。你的工作,是一项不同的任务,用你自己的措辞,由你来判断。四个具体的落差,把这两者区分开来,而分数再怎么提高,都弥合不了这些落差中的任何一个。

分数,是这个品类里最容易被引用的东西,也是预测能力最弱的东西。这不是在指控它不诚实;这是由一个基准测试要成为一个基准测试所必须具备的性质决定的。

本页内容
  1. 这些任务不是你的任务
  2. 这个提示词不是你的提示词
  3. 外壳没有被衡量
  4. 污染是一个真实、却悄无声息的问题
  5. 转投之前,人们通常会问

这些任务不是你的任务

基准测试,偏爱有可核实答案的问题:考试、谜题、能跑起来的代码。大多数真实的工作,靠的是判断,而不是核对,而没有任何基准测试能自动为判断打分。那个可衡量的子集,不是你一天工作的一个样本。

这个提示词不是你的提示词

分数,是用精心撰写、常常是专门为测试调校过的提示词产生的。而你会一边想着别的事,一边用一行字写下你的问题。一个优化过的提示词,和一个真实问题之间的差距,比两个头部模型之间的差距还要大。

外壳没有被衡量

基准测试,为模型打分,而你使用的是一个产品:指令、过滤器、界面、限制。一个高分模型,装在一个谨慎的产品里,产生的体验,会比一个低分模型装在一个精心打造的产品里更差。

污染是一个真实、却悄无声息的问题

热门的测试集,会泄露进训练数据里,这提高了分数,却没有提高能力。这一点从外部很难察觉,而它影响最大的,恰恰是被引用最多的那些基准测试,因为正是「受欢迎」这一点造成了它。

转投之前,人们通常会问

那基准测试就毫无用处了吗?

它们在追踪一个领域多年的发展、发现巨大差距方面是有用的。它们在给伯仲之间的竞争者排名这件事上很糟糕,而这恰恰是人们用它们来做的事。

盲测的人类偏好测试呢?

更接近有用一些,它们衡量的是在平均问题上的平均偏好。你的问题不是平均的,而对你来说,唯一重要的偏好,是你自己的偏好。

我应该完全无视分数吗?

用它们来列出一份候选名单,但永远不要用它们来从中做最终选择。用你自己的问题花二十分钟测试,比任何一张表格都能给出更好的判断。

跳过那张表格,在这里用你自己的三个问题来测试。

打开聊天

在不同AI聊天之间做选择