文件处理与导入问题
文件解析失败需确认是否开启【PDF增强解析】,未开启时需在Admin后台正确配置OCR模块以支持增强解析。文件出现中文乱码时,需将文件另存为UTF-8编码格式。Excel文件支持xlsx等格式上传,并非仅支持CSV格式。Tokens计算统一按照gpt3.5标准执行。
模型与配置规则说明
文件处理模型用于数据处理环节,包含【增强处理】和【问答拆分】两个步骤:增强处理会生成相关问题和摘要,问答拆分则执行问答对生成。索引模型用于向量化处理,通过对文本数据处理和组织,构建可快速查询的数据结构。恢复重排模型需在config.json文件中完成配置后,才可在系统中勾选启用。套餐到期后的数据保留规则为:免费版账号三十天未登录将清空知识库,应用配置不受影响;其他付费套餐到期后将自动切换为免费版。
回复与页面异常排查
当出现知识库结果过多导致回答中断、聊天记录触发上下文限制时,可参考系统给出的回复长度计算公式:最大回复=min(配置的最大回复(内置的限制),最大上下文(输入和输出的总和)- 历史记录),针对18K模型需注意输入与输出的总和限制,输出增多则需减小输入内容,具体排查步骤如下:
- 检查当前配置的最大回复上限;
- 减小输入内容,即减少历史记录(在工作流中对应“聊天记录”);
- 若为私有化部署场景,可在后台配置模型参数时预留上下文空间,例如将128000的模型配置为120000,剩余空间可分配给输出内容。
知识库页面出现闪烁问题,需检查并补齐索引模型的配置。
来源:https://doc.fastgpt.cn/zh-CN/guide/dataset/faq