
OpenAI 的 AI 计分卡是救星还是遮羞布?三个指标暴露了行业的自欺欺人
OpenAI 发布 AI 计分卡量化 ROI,但三个核心指标暴露了行业在自欺欺人:有用工作、单任务成本、算力回报率,谁在裸泳一目了然。

Collin
Full Stack Developer / 技术创作者
你还在用「感觉」衡量 AI 的投入产出吗?
上周 OpenAI 的 CFO Sarah Friar 发布了一个「AI 计分卡」,试图用三个指标量化 AI 的 ROI:有用工作(Useful Work)、单次成功任务成本(Cost per Successful Task)和算力回报率(Return on Compute)。
听起来很美好,对吧?但如果你真的在业务一线部署过 AI,你会知道这背后藏着一个残酷的真相:大多数企业根本不敢算这笔账,因为他们知道结果可能很难看。
我见过太多公司,花几十万部署一个客服 AI,最后发现人工兜底的成本比原来还高;也见过团队为了「跑通 MVP」,在单次任务成本上自欺欺人地忽略服务器和人工标注的开销。OpenAI 的计分卡,就像一面照妖镜,把那些用「未来愿景」掩盖当下低效的公司,照得清清楚楚。
核心论点:AI 计分卡是行业从「狂热叙事」转向「务实落地」的必然产物,但它的三个指标暴露了大多数 AI 应用当前的真实困境——投入产出比远未达到可持续的水平,而许多公司仍在用「伪指标」自我安慰。
「有用工作」:一个让大多数 AI 项目现原形的定义
计分卡的第一个指标是「有用工作」。什么算「有用」?不是完成 API 调用次数,不是生成 token 数量,而是真正对业务目标有贡献的任务。
举个例子:你用 AI 生成了 1000 封营销邮件,但打开率只有 0.1%,这算「有用工作」吗?按计分卡的标准,不算。
我采访过一家电商公司,他们用 AI 做商品描述生成,开发团队兴奋地报告「效率提升 300%」,但运营团队发现转化率下降了 15%。为什么?因为 AI 生成的描述千篇一律,缺乏真实场景的感染力。你看,用错了指标,AI 就是一把双刃剑。
金句:当 AI 的效率提升建立在牺牲质量的基础上,你得到的不是增长,而是更快的平庸。
「单次成功任务成本」:隐藏的冰山
第二个指标是「单次成功任务成本」。表面看很简单:总成本除以成功任务数。但难点在于「成功任务」的定义。很多公司把「任务完成」等同于「用户不抱怨」,这完全是掩耳盗铃。
我见过一个金融客服 AI,它的「成功」标准是用户没有升级投诉,但实际上用户因为无法解决复杂问题而流失了。这种隐形成本,计分卡能算出来吗?
Sarah Friar 的团队显然意识到了这个问题,所以他们强调成本要包含人工兜底、模型调用、微调和基础设施。但根据我接触的案例,绝大多数企业连「任务成功」的客观标准都没有定清楚。
如果你连什么是「成功」都定义不了,计分卡就是一张废纸。
「算力回报率」:最扎心的指标
第三个指标是「算力回报率」。这直接对应到你的 GPU 购买决策。现在很多公司囤积算力,仿佛算力本身就是资产。但计分卡提醒你:算力不是目的,回报才是。
算力回报率 = 有用工作产生的价值 / 消耗的算力成本。这个指标会让很多公司清醒:如果你花 100 万买算力,只产生了 80 万的价值,你就是在负增长。
有一个典型案例:某初创公司用大模型做代码生成,算力成本每月 50 万,但生成的代码只有 20% 被采用,且需要大量人工修改。按计分卡算,算力回报率不到 0.5。创始人看到这个数字后,果断砍掉了这个项目,转而采用更小、更专的模型。
金句:算力不是护城河,算力回报率才是。
计分卡之外,我们还需要什么?
OpenAI 的计分卡是一个很好的开始,但它不是万能药。它假设了企业有清晰的目标、准确的成本核算和客观的成功定义——这在现实中很少见。
更根本的问题是,很多公司部署 AI 的动机就不是为了 ROI,而是为了「跟上潮流」或「融资叙事」。对于这些公司,任何计分卡都只是装饰。
但如果你是真刀真枪在业务里用 AI,我建议你立刻开始用这个框架审视你的项目。不要用「感觉」来决策,用数据说话。把每项 AI 投入的算力回报率算出来,你会惊讶地发现,很多项目可能连电费都赚不回来。
最后,给你三个行动建议:
- 定义你的「有用工作」:不要用技术指标,用业务指标。比如客服 AI 的「有用工作」应该是「独立解决的客户问题数」,而不是「对话轮数」。
- 全成本核算:把 GPU 折旧、电费、人工标注、模型微调、维护团队的时间都算进去,不要只算 API 调用费。
- 设定止损线:如果算力回报率连续 3 个月低于 1,果断关停或重构。
你的项目经得起计分卡的检验吗?欢迎在评论区分享你的 ROI 数据——匿名的,真实的,因为只有面对数字,我们才能真的进步。
关注我,后续我会拆解更多 AI 落地的真实案例,帮你避开那些用钱堆出来的坑。