意图升值

我的博客

AI 时代工程师的稀缺资产:定义可验证的意图。

原理 · 2026-08-17

模型路由生态与 token 降价

纯省钱的「路由」会商品化,但「切换能力」会以别的理由转世。

现状:自动切换模型已经来了

围绕「自动选模型」,工具链已经出现一整套生态:

  • opencode:内置 small_model(轻量任务自动用便宜小模型);OpenRouter fallback(失败自动回退,可配 provider.order
  • 网关层:OpenRouter / LiteLLM 做自动路由 + fallback + 负载均衡
  • 路由专项:RouteLLM(LMSYS 开源,宣称降本 85%、保持 95% GPT-4 质量)、Not Diamond、Martian、Portkey
  • 产品层:Aider 的 architect / editor 双模型、Cursor / Windsurf 的「Auto」模式

但得泼一盆冷水:「按任务复杂度自动选模型」还不是成熟能力。 大多数「自动」只覆盖固定场景——轻量任务分流、失败回退、按标签路由。真正的「智能路由」仍在早期。

token 降价会淘汰什么:成本驱动的路由

路由的商业模式是:省下的钱 = 用贵模型的次数 × 价差。当价差趋近于零,路由就只剩开销。近年 frontier token 价格每年降大约一个数量级(DeepSeek 直接把推理价格打低了 10-100 倍)。

还有一个关键拐点:推理模型在处理简单请求时,可以几乎不做推理——等于用低算力回答简单问题。这让「省钱的 cost-tiering 路由」在 2-3 年内大概率大幅商品化。

但「切换能力」会转世

手机流量切换是个好类比:流量费用便宜了,但你仍然会在 Wi-Fi 和蜂窝之间切换——因为「切换」背后有别的理由。同样,路由的成本维度消失后,切换会以新的理由继续存在:

  • 延迟:等 3 秒 vs 等 20 秒,交互体验天差地别
  • 上下文窗口:这是最根本的约束——token 免费,也塞不进无限信息。compaction、JIT、subagent 全是结构性约束
  • 质量天花板:frontier 推理成本是物理约束,永远比本地 3B 模型贵一个量级
  • 本地 / 隐私 / 离线:本地简单、云端难,和「Wi-Fi 信号不好就切蜂窝」同构

时间线(粗略估计)

  • 现在 ~ 1 年:cost-router 仍能赚钱,主流 Agent 只做轻量分流
  • 2-3 年:前端模型处理简单任务成本趋近弱模型,纯省钱路由失去卖点,市场整合
  • 3-5 年:「默认用最好模型」成为主流(成本不再是约束),路由转向延迟 / 边缘 / 上下文维度
  • 长期:路由不死,但沦为上下文工程的一部分,不再是独立的省钱品类

一句话

稀缺的从来不是 token,而是注意力、窗口与上下文。降本路由会商品化,「切换能力」会以延迟、上下文、质量与隐私的形式转世。