词元语宙 logo:阴阳鱼与「词」「元」二字 词元语宙
LLM · 大语言模型 适合 企业决策者

模型选型与评估:别只看排行榜

排行榜会说谎,私有评估集不会:从任务、成本、延迟、合规四个维度选模型,把评估能力变成企业资产。

更新于 2026-09-25 # 模型选型# 评估# Benchmark# 成本

排行榜的两种失真

选模型时,大多数人的第一反应是看基准测试(Benchmark)排行榜——在标准数据集上跑分,分数高的就是好模型。这个直觉有一半是对的:榜单确实反映模型的通用能力水位。另一半是错的,原因有二。

刷榜(Benchmark Gaming)。 公开基准的题目可能混入了模型的训练数据,导致”背过答案”与”真的会做”无法区分。此外,针对热门基准做过优化的模型,分数与真实表现之间的差距会被系统性放大。榜单名次与实际体验不符,是行业内反复出现的现象 [待核实:各家基准的污染程度无公开一致结论]。

分布不匹配。 基准测的是”通用智能的平均值”,而你的业务只考一张卷子:你的用户、你的文档、你的格式要求、你的失败容忍度。一个总分离的模型,可能恰好在你那 20% 的关键场景上不稳。

排行榜可以当初筛,不能当选型依据。选型的真相只有一个来源:在你自己的数据上测。

四维选型框架

抛开榜单,企业选型建议用四个维度打分:

  1. 任务匹配度:模型在你的真实任务(而非通用基准)上的表现。这是唯一需要动手测的维度,方法见下节。
  2. 成本:按 token 计价的调用费用 × 你的预估调用量。注意长上下文场景成本随长度增长,参见《上下文窗口与记忆:大模型的工作记忆之谜》。
  3. 延迟:首 token 响应时间与整体生成速度。客服对话和离线批处理对延迟的要求差着数量级。
  4. 合规与部署:数据能否出境、是否需要私有化部署、供应商的合规资质与 SLA。这一维经常在项目后期才被发现是硬约束,应前置到选型第一天。

四维的权重因业务而异,但任何一维的硬性不及格都应一票否决——一个又便宜又快但把你客户数据送出境的模型,分数再高也不能选。

建立自己的评估集

评估集(Eval Set)是一组”问题 + 标准答案/评分标准”的集合,从你的真实业务中抽取:典型问题、困难案例、曾经出错的坏案例。选型时让候选模型盲测这套题,用同一把尺子量。

它不必很大。经验上,几十到几百个精心挑选、覆盖关键场景的案例,就足以区分候选模型;比十万条随手抓的数据更有用 [待核实:具体规模因任务而异]。关键不在量,在于三点:案例来自真实分布、包含已知失败模式、评分标准明确可执行(人或程序都能判对错)。

评估集的价值远不止选型一次:模型升级换代时回归测试、提示词改动后防退化、上线后质量监控,都用同一套题。没有它的团队,每次换模型都是一次赌博;有它的团队,迭代是可度量的工程。

观点:私有评估集是企业最被低估的 AI 资产

本篇观点:企业 AI 落地一年后,最有复利价值的资产不是提示词,也不是某个模型接入方案,而是私有评估集。

提示词会被模型换代作废,接入方案会被协议演进替代,而评估集沉淀的是”你的业务认为什么是好”——这是模型无关、供应商无关的资产,且随业务积累持续增值。它本质上是把组织对质量的隐性判断显式化、可执行化。现实是:绝大多数企业跳过这一步,直接上线,然后用用户的投诉充当评估集。成本孰高孰低,不难算。

模型本身的知识边界与幻觉问题,见《大语言模型:从词元到智能》。

小结

  • 榜单受数据污染与分布错配影响,只能当初筛,不能当选型依据。
  • 四维选型:任务匹配度、成本、延迟、合规,任何一维硬性不及格即一票否决。
  • 私有评估集不必大,但必须来自真实分布、覆盖失败模式、评分标准可执行。
  • 评估集是模型无关的质量资产,其复利价值被绝大多数企业低估。

延伸阅读

同专题更多文章