这个决定什么时候必须做
当业务使用多个模型或调用渠道,且需要按业务类型、成本或可用性选择调用路径时,应明确路由与降级策略。过早引入复杂调度会增加运维成本;过晚规划则可能放大模型宕机、超时或QPS限制对业务的影响。高成本模型处理低复杂度问答也可能增加调用费用。工具调用、多模态及备用模型应验证能力和响应格式兼容性;嵌入模型与向量数据库的变更另需评估检索和索引迁移。
判据矩阵
以下是可选的路由设计策略。具体触发条件、监控、切换和恢复需由所选网关或工作流实现并验证;延迟与恢复速度以部署测试为准。
| 候选路由/降级方案 | 支持的模型类型覆盖 | 配置实现难度 | 路由延迟开销 | 容错恢复速度 | 组件兼容性 | 可观测性支持 |
|---|---|---|---|---|---|---|
| 按请求业务属性分流 | 经验证的工具调用、多模态、普通问答等模型 | 中等,需定义请求类型与模型映射 | 取决于分类及规则执行 | 取决于备用模型兼容性和切换实现 | 验证网关或工作流对模型能力的支持 | 记录请求类型与路由结果;使用记录可辅助核对调用,业务属性需关联采集 |
| 按模型性能指标分流 | 能获得所需性能指标的模型 | 高,需集成指标采集与规则 | 取决于指标读取与决策方式 | 取决于采样、阈值和切换实现 | 验证监控组件与网关或工作流兼容性 | 采集响应时间、错误率和路由结果;可结合实际可用日志与第三方监控 |
| 按渠道健康状态分流 | 已验证认证与调用能力的渠道 | 取决于探测、错误分类和备用渠道配置 | 取决于健康探测与缓存方式 | 取决于超时、重试及切换规则 | 验证渠道鉴权、接口及模型能力 | 记录渠道状态、错误和切换结果;按AI Proxy或所用网关的实际能力配置并验收 |
| 按资源负载情况分流 | 可获取节点负载且支持调度的模型服务 | 高,需指标采集和调度实现 | 取决于指标读取与规则执行 | 取决于资源余量和调度实现 | 验证编排、网关及资源调度接口 | 关联资源指标与请求结果;可使用K8s metrics或第三方监控提供指标 |
| 按调用成本分流 | 具有可比较计价和业务质量的模型 | 中等,需价格映射及预算规则 | 取决于规则和成本计算方式 | 取决于备用模型兼容性与切换实现 | 验证网关或工作流的成本规则支持 | 统计token、费用与调用结果;使用记录可提供输入,路由规则需实际实现 |
| 混合多维度分流 | 经能力与接口验证的候选模型 | 高,需整合规则和冲突优先级 | 取决于指标与规则执行方式 | 取决于规则优先级和恢复实现 | 验证各项指标与调度依赖 | 关联业务、性能、健康、负载和费用数据;按实际采集字段配置面板和告警 |
每个判据为什么重要
支持的模型类型覆盖
该判据决定策略能否覆盖业务所需的模型能力。FastGPT v4.15.0增加多模态音视频输入支持,v4.8.20支持DeepSeek思考过程输出;实际路由与备用模型需验证工具调用、输入格式和输出处理。检索组件另有版本约束:现有Milvus部署按v4.16.2升级要求使用2.5.16及以上版本,并完成BM25相关迁移。检索迁移与模型调用路由应分别验证。
配置实现难度
配置复杂度直接影响部署与维护成本。FastGPT v4.17.0需要AI Proxy,AIPROXY_API_ENDPOINT填写服务根地址,AIPROXY_API_TOKEN使用有效的管理员Token。基础模型渠道配置与按业务、性能、负载或成本动态分流分别验收;后者的规则、指标和切换行为取决于所选网关或工作流实现。若继续使用其他聚合服务,也需验证接口、鉴权和调用链兼容性,并明确各层配置职责。
路由延迟开销
路由延迟影响整体响应时间,其开销取决于请求分类、指标采集、缓存和规则执行方式。单维度或多维度设计都应在目标并发下测量首响应和总耗时,并评估决策质量、超时与排队行为。前端请求优化和模型网关路由性能分别验收。
容错恢复速度
该判据决定模型故障时的业务恢复能力。应分别验证渠道健康探测、错误分类、超时、重试、备用渠道切换及恢复策略,并检查工具调用和流式响应的兼容性。v4.16.2的文件解析Worker线程调度属于文件处理配置;模型故障恢复时间需通过实际模型调用测试确认。
组件兼容性
组件兼容性需要覆盖FastGPT、AI Proxy、模型接口及实际使用的监控或调度组件。按目标版本说明检查依赖和环境变量。若同时调整检索引擎,例如现有Milvus部署升级BM25,应另行验证Milvus版本与迁移流程;其他向量引擎按各自支持情况处理。
可观测性支持
可观测性保障运维人员实时监控路由运行状态。FastGPT v4.8.20新增使用记录导出与仪表盘功能,v4.15.0优化了LLM请求追踪的团队隔离。缺乏可观测性的路由策略无法及时发现配置错误或模型异常,会导致问题扩大。例如无法统计各模型的调用频率、错误率,无法优化路由规则以提升性能与降低成本。
换的代价
更换模型路由策略需调整渠道、鉴权和规则,并测试业务类型分流、故障切换、工具调用、流式响应与成本统计。配置是否需要重启及切换窗口取决于实际组件,可通过逐步切流降低影响。增添聚合或监控组件时需核实依赖与管理职责。若同时更换嵌入模型或检索引擎,另行安排备份和索引迁移;现有Milvus部署采用v4.16.2的BM25迁移时,按官方流程迁至modeldata_v2并验证检索结果。
什么情况下这个决定可以先不做
单模型、低流量测试场景可先采用简单的渠道配置,并明确可接受的故障恢复方式。v4.17.0仍需完成AI Proxy的基础部署与配置。待业务类型、流量或可用性要求增加后,再选择动态路由和备用渠道策略;期间持续检查模型状态、超时和调用费用。
继续阅读
参考资料
- FastGPT v4.17.0 required AI Proxy dependency
- AI Proxy endpoint and token configuration
- FastGPT v4.16.2 Worker changes and Milvus migration scope
- FastGPT 环境变量
- FastGPT Docker Compose 部署
需要进一步确认时
上述判据可依据公开文档与部署实测逐项核对。若需要结合具体业务规模、数据边界与运维条件确定选型,可通过商务咨询获取评估支持;云服务形态可直接开始使用,先验证业务可行性再决定部署形态。