排名是一项强结论:它断言证据能够区分第一名和第二名。对这里的大多数供应商而言,大多数时候证据做不到这一点,而诚实的表达方式就是并列。
先看本站的单个评分是什么。它不是一个数字,而是三个。下限 是供应商已经明确获得的分数,把所有尚未测量的维度记为零。潜力上限 是假设每个未测维度都达到自身上限时可能获得的最高分;这些上限并非一律为十分:未测流媒体最高计 6.5,未测速最高计 8.5,因为我们无权把尚未验证的数字认证为满分。 展示分是大家熟悉的归一化平均值,并受约束而不能超过潜力上限。按比例绘制后,从下限到潜力上限的区间,就是我们尚不知道多少的诚实宽度。
证据唯一许可的排序
既然得到的是区间而不是点,就只有一种比较是安全的:当供应商 A 的保证最低分高于供应商 B 在所有未测项目都取最佳值时的最高可能分,A 才能排在 B 前面。
下限(A) > 潜力上限(B),则 A 支配 B。任何更弱的条件都只是我们碰巧研究各家多少所造成的产物,而不是有关供应商的事实。这是严格偏序,而它最重要的特性是拒绝做什么。它不会因我们研究供应商的先后次序而改变。为某家新增引用,它的下限只能上升;移除引用,下限只能下降。归一化平均值没有这种纪律:多研究一点,平均值可能向任一方向漂移,意味着基于平均值的榜单会部分按照我们的关注度给供应商排名。支配关系不会,这正是我们采用它的全部原因。
当前语料库实际说明什么
把规则应用到文章发布时的五家供应商,支配关系是空集。最高下限仍远低于最低潜力上限,所以没有任何一家供应商的保证最低分超过另一家的上限。没有任何对象支配任何对象。这不是数据缺陷,而是数据诚实表达仍有多少项目未测。当区间如此宽时,第一名与第五名确实重叠。
“前五名”会恰好掩盖这种重叠。若要印出 1、2、3、4、5,我们只能依据展示分——三个数字中唯一属于估计值而非边界的那个——并把证据无法辩护的差异当作研究发现。因此本站显示一次五家并列,将每个区间按比例画在旁边,并清楚说明尚无供应商脱离同组。
刻意不设决胜规则
早期版本的引擎曾按我们对每家研究了多少来打破平局,把我们了解最多的供应商推到前面。该规则已经删除,因为它奖励的是我们的覆盖率,而不是供应商的优点;其反面更糟,会悄悄惩罚研究最少的供应商。当证据没有区分任何对象时,不设决胜规则的并列才是正确输出。随着自有测量逐步补齐——首先是服务器真实性——下限会上升,潜力区间会收紧,真正的分离会出现。届时,那会是物理测量和文档真正支持的分离,而不是为了显得果断而强加的顺序。