来源:第三方行业研究(Zylos Research 2026 token 预算分析;LLM CFO、Addepto、FutureAGI 的 FinOps 分析)——非 Kernos 客户数据。它们描述的模式是结构性的。
Agent 循环本身——规划、工具调用、结果解析、重试——就是那 72%。每次重试都以全价重读一遍同样的上下文。
把一段摘要任务路由给处理最难推理问题的旗舰模型,是单一供应商配置的默认结局——账单翻三倍,质量零收益。
Agent 每一步都重发完整文档、schema 和历史。没有刻意的上下文纪律,同一批 token 一个任务里要买几百次。
一次 prompt 或模型变更悄悄弄坏了工作流。直到生产输出出错才有人发现——然后花钱重跑它碰过的一切。
最贵的 token 是写错之后的那个:对账、回滚、跨系统人工清理。一个没拦住的错误动作,比一个月的推理费用还贵。
如果 token 花费对应不到团队、功能或动作,看不见的就砍不掉。多数技术栈导出一张汇总账单就到此为止。
让 Agent 安全的同一套机制,也让它跑起来便宜——因为昂贵的失败模式全都是失控的失败。
每个写侧动作都是先暂存、按你的规则评估、再执行的提案。错误的写入到不了 SAP——你永远不用付那笔比 token 账单还贵的善后税。
每个 Agent 动作带着完整上下文上审计链——动了哪些对象、过了哪些规则、谁批的。token 预算按动作档位定价,花费对应可查的业务活动,不是一块黑表。
内置 evals 在变更上线前,用已知场景跑一遍你的工作流。坏掉的 prompt 挂在测试里,而不是挂在生产付款批次里。
自带端点、按任务选模型——本地或私有都行。摘要任务交给小模型,旗舰 token 只花在推理真正需要的地方。没有供应商锁死,没有单张账单的悬崖。
少数。行业分析一致认为生产 AI 成本的大头在模型账单之外——orchestration、检索、重试、可观测性基础设施。2026 年的一份分析(Zylos Research)给出 72% 在账单外。模型账单是花费可见的地方,不是花费结束的地方。
Agent 任务是一个循环:规划、调工具、读结果、重试、反思。token 预算研究记录到自主任务可达 500 万 token——聊天交互足迹的 50 到 500 倍。循环是产品本身,成本是结构性的,所以控制机制才是杠杆。
三个机制:暂存执行拦住错误动作(省下比推理还贵的善后成本);evals 在生产前拦住回归;模型可插拔,每个任务路由到价位合适的模型。我们不承诺降低模型账单——我们承诺消掉它周围的成本类别。
按动作 token 计费,不按席位:Starter $500/月(3 Agent、10K tokens)、Professional $2,000/月(10 Agent、100K tokens)、Enterprise 定制。每个动作都暂存且留审计,token 花费对应可查的业务动作。
不一定。FinOps 纪律——归因、预算、路由——在任何技术栈上都有效。Kernos 加上的是控制面:让 Agent 安全的暂存执行和审计链,同样让它的花费可归因、失败变便宜。如果你已经有 FinOps 工具、而且没有 Agent 在写你的记录系统,你可能暂时不需要我们。