外媒评论认为,企业在部署 AI 时,正把一种容易统计的数字当成效率指标:Token 用量。这种做法与早年即时战略游戏玩家迷信 APM(每分钟操作数)相似,看上去更忙,却未必带来更好的结果。
Token 用量未必更有效
文章提到,随着 AI 代理成为企业应用热点,模型调用量明显上升。Anthropic 此前发现,代理任务消耗的 Token 通常约为普通聊天的 4 倍,多代理系统则可达到约 15 倍。
作者认为,这类数字很容易被当成能力证明,但高消耗本身并不能说明输出更有价值。相反,生成内容越多,后续审核、校验和修正的工作也会同步增加。
游戏中的 APM 类比
文章用《星际争霸》等游戏举例称,APM 曾长期被视为高手指标,但后来的研究并未发现高水平玩家一定拥有更高的 APM。更关键的差异,往往在于判断、注意力分配和更有效的操作。
作者还提到,Google DeepMind 训练 AlphaStar 时发现,允许系统执行更多点击并不会提升表现,反而可能让算力浪费在细节上。该系统在与职业玩家的演示对局中,平均 APM 低于人类选手,但仍然获胜。
审核能力才是约束
文章认为,企业更该关注的不是生成了多少,而是能否稳定验证这些结果。文中援引一篇由 MIT、华盛顿大学和 UCLA 研究人员撰写的经济学论文称,AI 带来的增长约束已不再只是智能本身,而是人的验证带宽。
作者据此提出,企业部署 AI 时应把重点放在可观测性、审核流程和验证体系,而不是单纯追求更高的 Token 消耗。文章还援引 2025 年一项关于 AI 对软件开发影响的分析称,工程师花在审查和修改 AI 生成代码上的时间,占比已超过等待代码生成本身。
在作者看来,若企业只优化容易计数的代理指标,反而可能偏离真正目标。对 AI 系统而言,缺的不是继续放大生成量,而是先建立足够稳健的复核能力。











