这个品类的数据长什么样
实体瘤相关的质量文档数据源通常多样,包括临床试验方案、研究者手册、伦理审批文件、药物生产批记录、质量标准、检验报告等。这些文档的更新频率取决于临床试验阶段、药物研发进展和监管要求,例如临床方案修订可能每月发生,而生产批记录则随批次生成。文档结构上,PDF 格式的扫描件和结构化数据(如 CSV、JSON)并存,前者包含大量非结构化文本、图表和签名页,后者则多为试验数据、质控结果。字段方面,特有字段包括 RECIST 1.1 评估结果、PD-L1 表达水平、TMB 值、KRAS 突变状态等,单位涉及 mm(毫米)、%(百分比)、ng/mL(纳克/毫升)等。
这些特征在「HTTP 接口与外部系统」这一环带来什么约束
实体瘤质量文档的复杂性对 HTTP 接口与外部系统集成提出了特定要求。首先,大量非结构化 PDF 文档需要高效的文本提取和图像识别能力,这要求接口能够处理大文件上传,并与 OCR 服务集成。其次,文档更新频率不一,需要灵活的调度机制,例如通过 Webhook 实时触发更新,或者定期轮询特定目录。结构化数据中的特有字段,如肿瘤大小、基因突变信息,在通过 HTTP 接口传输时,需要定义清晰的 JSON Schema,确保数据类型和单位的准确性。对于 RECIST 1.1 等评估标准,接口设计需考虑其多层次的结构化表示,避免信息丢失。同时,应对外部系统可能返回的各种错误码,如文件过大、格式不支持、数据校验失败等,需要有健壮的错误处理和重试机制。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | 实体瘤文档常包含大量图片和扫描件,文件体积较大,需要支持大文件上传。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 大文件解析,特别是 OCR 过程耗时较长,避免解析超时导致失败。 |
maxContext | 3000 字符 | 文档段落较长,需保证足够上下文以理解复杂的医学描述和实验结果。 |
分段长度 | 800–1200 字符 | 确保单个分段内包含足够的临床上下文信息,同时避免过长影响召回效率。 |
召回条数 | 前 8 条 | 质量文档查询通常需要多角度信息交叉验证,增加召回条数可提高覆盖率。 |
相似度阈值 | 0.75 | 针对专业术语多的领域,适当提高阈值以确保召回结果的精准性。 |
容易做错的三处
- HTTP 请求返回 404 错误,原因在于外部系统接口地址配置错误或 API Key 未正确传递。
- 语音输入功能无法启用,现象是界面无响应或报错,原因通常是 Whisper 语音模型未正确部署或 FastGPT 的
TTS_SERVER环境变量未指向正确的模型服务地址。 - 上传大型 PDF 文档后,内容解析为空,原因可能是文档包含大量扫描图像未进行 OCR 处理,或者
PARSE_FILE_TIMEOUT_SECONDS设置过短导致解析中断。
怎么确认配好了
- 上传一份包含
RECIST 1.1评估结果的 PDF 文档,检查知识库中是否正确提取并索引了肿瘤大小、靶病灶数量等关键信息。 - 通过 HTTP 接口向外部系统提交一份模拟的质量控制报告,检查外部系统是否成功接收并处理,同时验证 FastGPT 是否能通过 Webhook 接收到外部系统的处理结果。
- 使用包含特定基因突变(如
KRAS G12C)的查询语句,验证系统能否从知识库中召回相关的临床试验方案或检验报告,并检查相似度阈值是否能有效过滤无关结果。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。