推文
@kafkaup · 2026-10-11 21:02
Uber 把内部 AI 查询从 20 分钟压到 30 秒,靠的不是换更强的模型,是先把自家数据理顺。 基础设施副总裁 Mattie Toia 说他们搭了个内部"上下文图谱",从 Jira 工单、系统设计文档、代码评审里抽出大约 2400 万个节点,专门喂给 agent 当上下文。token 用得更少,耗时反而大降。她还提到一件事:这几个月 agent 用量一直在涨,token 成本却稳住了。一部分来自子 agent 层面的缓存,另一部分只是让每个工程师都能看到自己烧了多少 token、折成多少钱。 我倾向于认为后面那条更管用。账单不可见的时候,没人会主动去优化。 Nebius 的 Marc Boroditsky 把这个转向叫 token maxing 到 value maxing,算清楚产出一份文档或填一张表要几轮交互、多少 token、多少美元。他说供应商和客户之间合适的经济模型还没找到,Nebius 已经在跑算力拍卖和 spot 定价,对按结果付费也开放。NVIDIA 讲的是 Dynamo 复用 KV 缓存里算过的部分,以及一颗芯片靠软件五年能再榨出三到五倍性能。 这场圆桌是 Nebius 的品牌内容,推销味不轻。但 Uber 那组数字是真的,它说明现在企业用 AI 卡住的地方,多半不是算力不够,而是数据没人整理、成本没人看。
曝光 409 · 评论 0 · 点赞 0 · 书签 3 · 曝光/时 63.3681764827875