OpenRouter推出全新技术,助力AI多轮对话成本大幅降低!
速读:在AI对话技术不断发展的背景下,OpenRouter近日发布了两项创新技术——提示词缓存(PromptCaching)和粘性路由(StickyRouting),旨在显著降低多轮智能体对话的token成本。
在 AI 对话技术不断发展的背景下,OpenRouter 近日发布了两项创新技术 —— 提示词缓存(Prompt Caching)和粘性路由(Sticky Routing),旨在显著降低多轮智能体对话的 token 成本。这一新技术的推出,意味着开发者在与智能体进行长时间交互时,能够享受到更低的费用,从而推动智能体应用的普及。
在多轮对话中,智能体通常需要反复发送相同的系统提示词、工具定义和策略指令。这导致在长达六轮的会话中,即使用户只更改了一次输入,开发者也需为这些重复的提示词支付多次费用。而通过提示词缓存,OpenRouter 可以从缓存中读取重复的部分,避免了高额的重复收费。根据不同的服务提供商,缓存读取的成本仅为正常输入价格的0.1到0.5倍,极大地降低了费用。在 Claude Sonnet4.6模型上,缓存读取的价格仅为每百万 token0.30美元,而正常输入价格为3.00美元。

为了确保这一机制在多轮对话中持续有效,OpenRouter 的粘性路由技术将后续请求固定到持有热缓存的同一提供商,这样一来,开发者就能在不同的对话轮次中继续享受到低价的缓存读取服务。
然而,要充分利用这一创新技术,开发者需确保在使用过程中保持同一条会话。对于缓存的有效性,OpenRouter 建议用户设置 session_id,这样可以在 首次 请求成功后立即启用粘性路由,而不仅仅在缓存命中之后。此外,开发者可以通过查看请求响应中的使用数据,轻松确认缓存是否生效。
随着 AI 技术的不断进步,OpenRouter 的这一新技术不仅为开发者提供了成本控制的利器,也为智能体的应用场景拓展打开了新的可能。