AI使用笔记

笔记用量与成本

推理模型的「思考强度」,先看默认值

有些推理模型提供一个「思考强度」参数,分成低、高、最高几档。我调研一个准备接入的模型时,据当时查到的第三方资料,它的默认值就是最高档,而且推理不能完全关掉。这些我没有找到官方原文核对,接入前还要再确认。

为什么要紧

单价没有变,变的是输出的长度。思考得越多,输出的 token 越多,而输出恰好是按 token 计价里最贵的部分。那份第三方资料里有一组测试:同一个简单的分类任务,最高档的输出长度是最低档的三十多倍。这只是一个任务上的数字,不代表所有情况,但方向很清楚。

对我们来说这很要命:每人的额度用完即停,不会自动恢复。如果放着默认的最高档不管,额度会比预期快得多地用光。

打算怎么做

这个模型我们最后还没有接入。如果要接,计划这样处理:

  • 在网关的渠道设置里用「参数覆盖」,把思考强度统一设为中间一档。它会覆盖使用者自己传入的值,成本由管理员控制。
  • 不直接设成最低档。那等于把推理模型最有价值的能力关掉了,还不如换一个便宜的普通模型。
  • 接入前先查清三件事:默认档位是哪个、能不能关闭、输出价格是输入价格的几倍。