智能路由
智能路由
不想自己挑模型?把 model 设为 auto,零词元会先评估问题的难度,再从你的 API Key 所在分组可用的模型里挑一个合适的来回答。简单问题用便宜的模型,难题用更强的模型,代码其余部分不需要任何改动。
选择模式
model 填写下面任意一个路由模式(不区分大小写):
表中"轻量 / 标准 / 高级 / 推理"是模型档位。站点管理员可以为每个档位指定候选模型;没有指定时,系统会按本站可用模型的价格自动分档:价格最低的三分之一为轻量档,中间三分之一为标准档,最贵的三分之一为高级档,支持推理的模型组成推理档。同一档位内优先选择价格更低的模型,推理档优先选择能力最强的模型。
提示:模式和档位以本站实际配置为准,可以在模型目录顶部的"智能路由"中查看当前每个档位包含哪些模型。
如何判断难度
每个请求都会在转发前快速评分(不调用额外的模型、几乎不增加延迟),分数在 0 到 1 之间,按阈值分为简单、中等、困难三档。主要依据:
长度:最后一条提问和整个上下文越长,分数越高; 代码:包含代码块、报错堆栈、"写一个函数 / 实现 / 调试 / 重构"等编程任务; 数学:公式、LaTeX,或"证明 / 推导 / 求解"等; 分析与设计:如"分析 / 比较 / 设计 / 方案 / 架构 / 分布式 / 高并发 / 一致性"; 多重要求:提问里列出了多条编号要求; 请求参数:带工具(tools)、结构化输出、很大的 max_tokens; 简单意图:问候、简短翻译、"什么是…"这类短问题会降低分数。
如果你在请求里显式开启了推理(OpenAI 的 reasoning_effort 为 medium 及以上、Responses 的 reasoning.effort,或 Anthropic 的 thinking),请求会直接按"困难"处理。
管理员也可以开启"模型判定":在规则评分拿不准时,额外让一个小模型判断难度;判定失败或超时会自动退回规则评分。
能力匹配
选模型前会先排除不满足请求能力要求的模型:
请求带图片时,只选支持图片输入的模型; 请求带工具时,只选支持工具调用的模型; 显式开启推理时,优先选支持推理的模型; 上下文很长时,只选上下文窗口放得下的模型(估算输入超过窗口的 70% 视为放不下)。
如果目标档位里没有合适的模型,会先尝试更高的档位,再尝试更低的档位。分组内完全没有可用模型时,请求会返回 400 错误。
支持的接口
智能路由对以下接口生效:
POST /v1/chat/completions(以及 /chat/completions) POST /v1/responses(以及 /responses) POST /v1/messages(Anthropic 格式)
请求体中只能有一个 model 字段。
查看实际使用的模型
响应头会告诉你这次路由的结果:
在控制台的用量记录里,这类请求会显示你请求的路由模式(如 auto),以及实际路由到的模型。
计费
按实际使用的模型价格计费,智能路由本身不收取任何额外费用。
示例