故障排查GitHub issue2 分钟阅读排错/错误码

排查FastGPT私有化部署知识库索引状态卡住的问题

私有化部署FastGPT 4.9.6版本时,调用知识库OpenAPI批量推送60条文本数据,使用千问text-embedding-v4索引模型。约30%的知识库集合的索引状态卡在「1组索引中」,持续数小时无变化。此时训练状态显示「已就绪」,索引排队状态为「空闲」,且无对应数据量更新。

现象

私有化部署FastGPT 4.9.6版本时,调用知识库OpenAPI批量推送60条文本数据,使用千问text-embedding-v4索引模型。约30%的知识库集合的索引状态卡在「1组索引中」,持续数小时无变化。此时训练状态显示「已就绪」,索引排队状态为「空闲」,且无对应数据量更新。

可能原因

可推测的潜在原因包括批量推送的数据量超过当前部署的处理上限、索引任务队列出现异常阻塞、模型调用环节出现未被捕获的错误,或部署环境的资源不足以支撑批量索引任务。

排查步骤

  1. 检查FastGPT部署服务器的CPU、内存、磁盘IO与网络带宽的实时占用情况。
  2. 查看FastGPT后台日志,检索与索引任务、模型调用相关的异常日志或报错文本。
  3. 测试单条数据的索引流程是否正常,排除单条数据的格式或内容问题。
  4. 确认当前部署的索引队列配置参数是否合理,排查参数设置导致的阻塞。
  5. 拆分批量推送的数据批次,比如将60条数据拆分为更小的批量,重新推送测试。

解决与验证

根据排查出的具体问题进行对应处理。例如,若为资源不足,可优化服务器配置或调整并发任务数量;若日志发现异常,根据报错信息修复对应环节;若为队列阻塞,可重启相关服务重置任务队列。验证方式为:重新推送调整后的批量数据,观察知识库集合的索引状态是否从「1组索引中」切换为「已就绪」,且对应数据量正常更新。

来源:FastGPT GitHub issue