每月85,000美元。
那是AI API法案 坐在我客户的收件箱里 当他们给我打电话 在上季度的轻微恐慌。
他们在浦那经营一个中型电子商务业务——每天约4000个订单——并将AI纳入客户支持,产品描述和内部报告.
人工智能的工作非常出色。
发票没有。
三周后,他们的每月账单是12 400美元。
相同的任务。
同样的品质。
不许割角 这正是改变。
真正的问题:每个任务都是使用最昂贵的模型 当我审核他们的设置时,这个问题在5分钟内就很明显了.
API的每次通话——无论是将客户投诉归类为8个类别之一还是生成2000个字的产品说明——都冲击着同样的溢价模式。
我最常看到的错误是企业采用AI:他们在概念证明阶段选择一个模型,在规模上永远不要重温这个决定.
你不会雇一个高级包机会计 做数据输入。
但这基本上是正在发生的情况——一个顶级推理模型回答"这是关于航运或计费的抱怨吗?".
Fix 1:模型路由——单一最大的成本杠杆 模型路由意味着将每个任务送到最便宜的能以可接受的质量处理的模型.
我把他们的~47个不同的API呼叫类型分为了三个层次. 68%的电话转到了轻量级,20%转到了中级,只有12%停留在保费上。
这一单项更改将账单从QQ85K降到了大约QQ38K——没有质量损失,经过两周的A/B测试,在完全切换前对客户满意度分数进行了核实.
步骤2:快速缓存——停止为同一上下文支付两次费用 他们的支持bot发送了同样的1200个托肯系统,与每一个调用——政策,语气,目录背景,在上千个日常调用中都是相同的.
缓存处理它一次 并廉价地在窗口内的电话上引用它。
每天~6000支持互动,仅此就节省了每月~8000-10,000.
步骤3:击破非紧急请求 不是每件事都需要实时反应 他们的内部报告在每个数据点到达时都单独拨打——60至80个电话,可分出3至4个。
我们每天早上6点,下午2点,晚上10点 在窗户里收集 批量定价一般是实时的一半,延迟几个小时对于内部报告来说是罚款的.
Fix 4:输出符纪律 他们的产品提示要求"一个详细,全面的描述",当200-300是真正需要的时候得到了800-1000个符.
我们用明确的长度和结构来改写它们:"写成确切的3句.
何谓.
关键利益。
是为谁. " 产出代币成本高于投入;在上千个日常电话复合体中缩短了60%的长度.
最后数字 85%的减产,85000到12400,同工.
客户满意度实际上提高了3%——较轻的模型反应更快,人们更喜欢快速回答,而不是略微雄辩的答复。
大多数人对人工智能成本有什么错误 直觉是买个便宜的供货商 真正的杠杆是建筑。
我见过企业三次交换供应商,而且仍然付出了过高的代价,因为模式——一种一切的模式,没有缓冲,动词输出——永远不会改变.
如果你的账单比你想的要高,问:有多少个电话实际上需要保费模型?
你重复发送同样的语境吗?
有电话可以接吗?
您的提示请求的输出量是否超过您使用的数量 ?
答案通常显示,60-80%的账单是隐藏在平地可见的浪费.
你不需要在AI上少花钱.
你需要花更聪明。
我在Architmittal.
最初出版于此.