这个品类的数据长什么样
多肽药物的药物警戒数据主要来源于临床试验报告、真实世界研究(RWE)数据、药品说明书、医学文献以及不良事件报告(ADR)系统。这些数据更新频率较高,尤其是在新药上市后,ADR 报告会持续涌入。文档结构呈现多样性,临床试验报告通常为结构化的 PDF 或 Word 文档,包含详细的患者信息、用药方案、不良事件描述、实验室检查结果等,部分内容以表格形式呈现。医学文献多为非结构化的科研论文,其中不良反应信息散布在正文、图表和附录中。ADR 报告则通常是半结构化的 XML 或文本文件,包含患者标识符、药物名称、剂量、给药途径、不良事件术语(如 MedDRA 编码)、发生时间、结局等字段,剂量单位常涉及毫克(mg)、微克(µg)、单位(U)等,且报告中常出现医学缩写和专业术语。
这些特征在「文档解析与分块」这一环带来什么约束
多肽药物数据来源的广泛性,导致文档格式多样,影响了统一解析的效率。特别是扫描版 PDF 和图片格式的报告,需要高质量的光学字符识别(OCR)处理,以确保文本内容的完整性。高频更新的 AD R报告流要求解析系统具备实时处理能力,避免信息滞后。文档中包含的复杂表格结构,例如临床试验报告中的不良事件列表,要求解析器能准确识别表格边界、行与列关系,并提取单元格内容。医学专业术语和缩写的大量存在,对分块后的语义完整性提出挑战,需要确保分块不割裂关键医学概念。此外,多肽药物独特的剂量单位(如 U)和给药方式描述,要求解析器在分块时能保留这些关键信息,以便后续的实体识别和关系抽取。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800-1200 字符 | 兼顾语义完整性和召回效率,避免过长段落稀释关键信息,过短段落割裂医学概念。 |
重叠长度 | 150 字符 | 确保分块边界处的语义连贯性,尤其在表格或长句跨越分块时。 |
OCR_ENABLED | true | 处理扫描版 PDF 和图片格式的 AD R报告,确保文本可解析。 |
MAX_FILE_SIZE_MB | 500 MB | 适应大型临床试验报告和医学文献,避免文件上传失败。 |
PARSE_TIMEOUT_SECONDS | 600 秒 | 应对复杂文档(如多页表格、大量图片)的解析耗时,防止超时中断。 |
TABLE_EXTRACTION_MODE | advanced | 准确解析临床试验报告中多层嵌套或合并单元格的表格结构。 |
容易做错的三处
- 上传扫描版 PDF 后,知识库搜索结果为空,原因在于未启用 OCR 功能,导致图片内容无法被识别为文本。
- 知识库分块后,多肽药物的剂量信息(如“100 U”)在不同分块中被割裂,原因是
分段长度设置过小,且重叠长度不足以覆盖关键短语。 - 上传多个 AD R报告文件后,系统显示部分文件解析失败,状态码为
504 Gateway Timeout,原因是PARSE_TIMEOUT_SECONDS设置过短,无法应对长文件或复杂结构的解析耗时。
怎么确认配好了
- 随机抽取多肽药物临床试验报告、药品说明书和 AD R报告,上传至知识库,检查每个文档是否都能成功解析并生成分块。
- 对包含复杂表格的 PDF 文件进行解析,检查表格内容是否能被正确提取,且表格中的关键数据(如不良事件发生率、剂量)在分块中得到保留。
- 在知识库中搜索特定多肽药物的剂量、不良反应术语(如“恶心”、“呕吐”)、给药途径等,检查召回的分块是否包含这些关键信息,且语义完整。
- 上传包含医学缩写(如“QD”、“BID”)的文档,验证解析后的分块是否能正确识别并保留这些缩写,或将其展开为完整词汇。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。