从4.15.0版本起,FastGPT开源版不再读取config.json配置文件。从旧版本升级的用户,需删除该文件的volume挂载,并将原config.json中的配置转换为环境变量。未使用过可选配置的用户无需额外操作。以下是原config.json字段与对应环境变量、默认值及说明的对应关系:
| 原config.json字段 | 环境变量名 | 默认值 | 说明 |
|---|---|---|---|
| systemEnv.customPdfParse.url | CUSTOMPDFPARSE_URL | 空 | 自定义PDF解析服务地址。 |
| systemEnv.customPdfParse.key | CUSTOMPDFPARSE_KEY | 空 | 自定义PDF解析服务密钥。 |
| systemEnv.customPdfParse.doc2xKey | DOC2X_KEY | 空 | Doc2x PDF解析服务密钥。 |
| systemEnv.customPdfParse.textinAppId | TEXTINAPPID | 空 | 合合信息TextIn服务App ID。 |
| systemEnv.customPdfParse.textinSecretCode | TEXTINSECRETCODE | 空 | 合合信息TextIn服务Secret Code。 |
| systemEnv.hnswEfSearch | HNSWEFSEARCH | 100 | 向量检索的hnsw.ef_search参数,仅对PG、OceanBase、openGauss生效。 |
| systemEnv.hnswMaxScanTuples | HNSWMAXSCAN_TUPLES | 100000 | 向量检索最大扫描数据量,仅对PG生效。 |
| systemEnv.datasetParseMaxProcess | DATASETPARSEMAX_PROCESS | 10 | 知识库文件解析队列最大并发数。 |
| systemEnv.vectorMaxProcess | VECTORMAXPROCESS | 10 | 向量训练队列最大并发数。 |
| systemEnv.qaMaxProcess | QAMAXPROCESS | 10 | 问答拆分队列最大并发数。 |
| systemEnv.vlmMaxProcess | VLMMAXPROCESS | 10 | 图片理解模型处理队列最大并发数。 |
FastGPT开源版支持接入多种PDF增强解析服务,包括自定义服务、SoMark、TextIn和Doc2x。调用优先级为自定义PDF解析服务 > SoMark > TextIn > Doc2x,选择其中一种服务配置即可。
具体配置步骤
- Sealos PDF解析服务:先申请API Key,然后配置环境变量:
CUSTOM_PDF_PARSE_URL = https://aiproxy.hzh.sealos.run/v1/parse/pdf?model=parse-pdf
CUSTOM_PDF_PARSE_KEY = your-sealos-api-key- SoMark:创建API Key后,配置环境变量
SOMARK_API_KEY = sk-your-api-key。该服务单文件最大支持200MB、300页,完整限制和错误码可参考SoMark API文档。 - 其他自定义PDF解析服务:配置环境变量:
CUSTOM_PDF_PARSE_URL = https://your-pdf-parser.example.com/v2/parse/file
CUSTOM_PDF_PARSE_KEY = your-service-key其中CUSTOM_PDF_PARSE_KEY可选,配置后FastGPT会通过Authorization: Bearer <CUSTOM_PDF_PARSE_KEY>发起请求。解析服务需接收multipart/form-data POST请求,包含file字段,并返回格式为{"pages": 10, "markdown": "Parsed Markdown content"}的JSON数据。
- TextIn:配置
TEXTIN_APP_ID = your-app-id和TEXTIN_SECRET_CODE = your-secret-code。 - Doc2x:配置
DOC2X_KEY = your-api-key。
完成所有环境变量配置后,需重启FastGPT。在知识库导入文件或应用文件上传配置中勾选“PDF增强解析”,上传的PDF才会使用已配置的增强解析服务;未勾选时仍使用FastGPT内置解析器。
来源:FastGPT 官方文档