公众号:数字生命卡兹克 · 2026/8/10

我花了54个小时,做了一个可能更公平的AI大模型排行榜

作者耗时54小时,开发并免费开放了AI大模型综合排行榜 LatentRank。它聚合多家可信榜单,采用 Bradley-Terry 成对比较算法,并加入先验限制小样本结果,以减少不同榜单规模、领先幅度和模型缺失造成的评分偏差。目前前五名中,Opus 5 超过 Fable 5 居前。

我花了54个小时,做了一个可能更公平的AI大模型排行榜。

作者耗时54小时,开发并免费开放了一个聚合多家可信榜单的AI大模型综合排行榜 LatentRank。该榜单采用 Bradley-Terry 成对比较算法,并加入先验来限制小样本结果,从而解决不同榜单规模、领先幅度以及模型缺失所带来的评分偏差。目前榜单前五名中,Opus 5 超过 Fable 5,位居前列。

FDE 判断

LatentRank 为 FDE 在企业 AI 项目中的模型选型提供了更公平的第三方参考,帮助降低单一榜单偏差对技术决策的影响。FDE 可借此在不同榜单规模、领先幅度和模型缺失条件下比较模型,提升交付前评估效率;对依赖 Agent 和大模型能力的企业交付场景,也具有实用参考价值。