这个品类的数据长什么样
适应症数据主要来源于药品说明书、临床指南、药品监管机构发布的批准文件以及临床研究报告。这些文档的更新频率受药品上市、临床试验进展和政策法规调整影响,通常是季度或年度更新。文档结构以半结构化为主,包含大量表格(如剂量用法表、不良反应发生率表)和自由文本描述。字段与单位具有高度专业性,例如剂量(mg/kg、g/次)、频率(次/日、q.d.)、疗程(天、周),以及特定的医学术语和疾病分类编码。这些数据通常以 PDF、Word 或纯文本格式存在,其中 PDF 格式占据主流。
这些特征在「文档解析与分块」这一环带来什么约束
适应症文档的半结构化特性对解析提出了挑战。表格数据需要准确识别并转换为可查询的结构,避免表格错位或内容丢失,这直接影响后续问答的准确性。专业医学术语和疾病编码的存在,要求分块时能保持术语的完整性,避免因分块导致关键信息被截断,影响语义理解。数据更新频率决定了知识库需要定期进行文档解析与分块,以确保信息的时效性。此外,文档中涉及的敏感医学信息,要求解析过程必须在本地化环境中进行,确保数据安全和隐私合规性,避免文件内容外泄风险。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾语义完整性和召回效率,避免过长或过短导致信息丢失或冗余。 |
分段重叠长度 | 100–200 字符 | 确保上下文连续性,避免分段边界处语义断裂。 |
分隔符 | \n\n、。、; | 优先按自然段落和句子结构切分,保留语义单元的完整性。 |
PDF 解析模式 | 文本优先 | 适应症文档中文字信息密度高,确保文本提取的准确性。 |
表格解析策略 | 结构化提取 | 适应症文档中包含大量关键表格数据,需要精确识别表格边界和单元格内容。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型或复杂文档解析的耗时,防止因超时导致解析失败。 |
容易做错的三处
- 上传的 PDF 文件中表格内容出现错位或缺失,原因在于默认解析器对复杂表格结构的支持有限,未能正确识别表格边界。
- 文档解析后,部分专业医学术语被错误截断,现象是问答结果中术语不完整,原因在于分段长度过小或分隔符选择不当,未能保持语义单元的完整性。
- 文件上传后解析长时间无响应或报错超时,原因在于文件体积过大或内容复杂,超过了
PARSE_FILE_TIMEOUT_SECONDS参数设定的阈值。
怎么确认配好了
- 选择一份包含复杂表格和专业术语的适应症 PDF 文档进行解析,检查解析后的文本分块中表格内容是否完整且无错位。
- 随机抽取解析后的文本分块,核对其中是否包含被截断的医学术语或关键信息,确认分块边界合理。
- 上传多个不同大小和复杂度的适应症文档,观察解析耗时,确认在设定的
PARSE_FILE_TIMEOUT_SECONDS内完成解析。 - 使用 FastGPT 的知识库预览功能,检查分块内容是否符合预期,特别是表格和关键字段的呈现。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。