这个品类的数据长什么样
罕见病制度的数据主要来源于国家卫生健康委员会、药品监督管理局、医疗保障局发布的政策文件、指南、专家共识,以及各省市地方性实施细则。这些文档通常以 PDF、Word、或结构化 XML 格式发布,内容涵盖罕见病目录、诊疗路径、用药保障、科研伦理等。更新频率相对较低,但一旦发布,其条款具有长期约束力。文档结构复杂,包含大量法律法规条文、医学术语、缩写、表格、图示及引用。字段与单位方面,常涉及疾病编码(如 ICD-10)、药品通用名、特定治疗方案的剂量单位(mg/kg)、费用代码等,且存在大量交叉引用和定义。
这些特征在「文档解析与分块」这一环带来什么约束
复杂且不规则的文档结构,特别是嵌套的条款和大量的表格,对文档解析的准确性提出高要求。解析器需要能够识别不同层级的标题、段落、列表和表格,并正确提取其内容,避免信息丢失或错位。医学术语和缩写密集,可能导致分词不准确,影响后续的语义理解和召回。文档更新频率低,意味着初期解析工作量大,但后期维护成本相对可控,重点在于确保解析的完整性和规范性。条款间的交叉引用要求在分块时考虑上下文关联性,避免割裂关键信息。字段与单位的特异性,如剂量单位,需要解析器能区分数字与单位,确保数值的正确性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | 罕见病政策文件可能包含大量扫描件或高分辨率图片,文件较大。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 大型 PDF 或 Word 文档解析耗时较长,避免超时中断。 |
分段长度 | 800–1200 字符 | 罕见病制度文档的段落通常较长,包含完整的政策条款或医学描述。 |
分段重叠 | 100–200 字符 | 确保分段边界上下文衔接,防止重要信息在分段处被截断。 |
表格解析策略 | 结构化提取 | 制度文档中包含大量表格,需准确提取表格内容及其语义关系。 |
嵌入模型 | text-embedding-ada-002 | 适用于处理专业领域文本,对医学术语和政策条文有较好理解。 |
容易做错的三处
- 上传大型 PDF 文档时提示
timeout of 360000ms exceeded:这通常是PARSE_FILE_TIMEOUT_SECONDS配置过低,未能覆盖文档解析的实际耗时。 - 部分 Word 文档上传后,表格内容未能正确分块或缺失:文档内嵌的复杂表格结构未能被解析器识别,导致内容提取不完整。
- 问答结果未能完全引用知识库原文的“答复”:知识库分块粒度过细,导致原文的完整语境被分割,模型在召回时未能获取完整的“答复”上下文。
怎么确认配好了
- 选取具有代表性的罕见病制度文档,上传后检查知识库中是否完整保留了所有文本内容,特别是长段落和表格信息。
- 针对文档中的关键条款、定义或特定医学术语,进行问答测试,验证召回结果是否准确且包含原文。
- 检查知识库中分块的长度和重叠情况,确保每个分块都包含足够上下文,并避免关键信息被割裂。
- 使用 FastGPT 的知识库预览功能,随机抽取多个分块,人工核对其内容是否语义完整、无截断。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。