这个品类的数据长什么样
患者援助项目(PAP)的质量文档主要源于制药企业、慈善机构及医疗机构。这些文档的更新频率通常较低,主要集中在年度审核、政策调整或新项目启动时。文档类型多样,包括项目方案、操作手册、申请表、审核标准、培训材料等,多数以 PDF 格式存在。结构上,它们往往包含大量规范性文本、表格数据和流程图。文档中常见特定字段,如患者姓名、身份证号、疾病诊断、药品名称、剂量单位(如 mg、ml)、赠药周期、审批状态等,且对数据准确性和一致性有极高要求。
这些特征在「文档解析与分块」这一环带来什么约束
患者援助质量文档的低更新频率意味着初期解析准确性至关重要,后续重复处理的成本相对较低。大量规范性文本和表格数据要求解析器能有效区分文本段落和结构化信息,避免表格内容被错误地断句。包含敏感信息(如患者身份)的特性,使得在文档分块时需特别注意避免将零散敏感信息单独成块,这可能导致召回时泄露。此外,特有的医学和药学专业术语,以及对剂量单位的精确识别,对分词和嵌入模型的通用性构成挑战,需要更精细的文本预处理。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 平衡了长文本的上下文保持与短文本的检索效率,兼顾了表格内容的完整性。 |
分段重叠率 | 0.1 | 确保上下文衔接,同时避免过多冗余,尤其适用于规范性文本。 |
chunk_overlap_ratio | 0.1 | 对应 分段重叠率,确保分块间的平滑过渡。 |
embedding_model | text-embedding-ada-002 或同等级模型 | 能够较好地理解医学和药学专业术语的语义关联。 |
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 多数 PDF 文档解析耗时在可控范围内,避免因大型文件解析失败。 |
maxContext | 3000 Tokens | 保证在召回后,能够提供足够的上下文信息进行准确判断。 |
容易做错的三处
- 解析大型 PDF 文档时出现
PDF parsing timeout错误,这是因为PARSE_FILE_TIMEOUT_SECONDS参数设置过低,未能覆盖文档解析所需时间。 - 召回结果中表格数据支离破碎,字段与数值无法对应,原因是文档解析时未能识别表格结构,导致表格内容被错误地切分成多个不完整的文本块。
- 问答时无法准确识别药品剂量单位,例如
mg和ml,这通常是由于选用的嵌入模型对特定领域的专业词汇理解不足,或预处理阶段缺乏针对性的词汇增强。
怎么确认配好了
- 选择一份包含复杂表格和规范性文本的患者援助文档进行解析,检查解析后的分块是否完整保留了表格结构和文本段落的逻辑连贯性。
- 针对文档中的特定专业术语和敏感字段,执行检索测试,验证召回结果是否准确且上下文完整,敏感信息是否被合理分块。
- 使用 FastGPT 的测试问答功能,围绕文档内容提问,观察模型对剂量单位、项目流程等关键信息的理解和回答准确性,评估其是否符合预期。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。