这个品类的数据长什么样
药物经济学数据多来源于临床试验报告、真实世界研究(RWE)数据、医疗成本分析报告、药企内部市场准入文档以及政府药品采购与报销政策文件。这些文档通常以 PDF 格式为主,包含大量结构化和半结构化数据,例如疾病负担数据、治疗路径、药物定价、报销标准、成本效益分析模型和敏感性分析结果。数据更新频率相对稳定,通常与新药上市、适应症扩展或医保目录调整周期相关。文档中常见的字段包括 QALYs (质量调整生命年)、ICER (增量成本效果比)、药物通用名、商品名、剂量、给药途径、治疗周期、患者群体特征、以及各种货币单位(如 USD、EUR、CNY)和时间单位(如年、月、周)。
这些特征在「文档解析与分块」这一环带来什么约束
药物经济学文档的数据特征对文档解析与分块提出了特定要求。首先,文档中包含的表格和图表是核心信息载体,例如成本效益矩阵、敏感性分析结果图。这意味着单纯的文本分段不足以捕获完整语义,需要支持表格和图像内容的结构化提取。其次,文档篇幅普遍较长,常常数百页甚至上千页,且信息密度高,要求解析器能高效处理大型文件,避免内存溢出或超时。第三,专业术语和缩写众多,例如 QALY、ICER 等,分块时需保证这些关键指标及其上下文的完整性,避免因截断导致语义缺失。第四,货币和时间单位在不同报告中可能存在差异,影响后续的数值比较和计算,分块时需要保留这些单位信息。最后,文档中常包含多层级标题和章节结构,父子分块功能对于维持文档逻辑层级至关重要,能有效提升召回准确性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾语义完整性与召回效率,避免过长分段引入噪声,过短分段丢失上下文。 |
分段重叠 | 100–200 字符 | 确保相邻分段之间的语义连续性,防止关键信息被截断。 |
父子分块 | 启用 | 药物经济学文档结构复杂,包含多级标题,启用后能更好地保留文档层级关系。 |
表单识别 | 启用 | 文档中存在大量成本效益分析、敏感性分析等表格数据,启用后可结构化提取。 |
图片OCR | 启用 | 提取图表中包含的关键文本信息,如轴标签、数据点说明、图例等。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 大型 PDF 文档解析耗时较长,增加超时时间以确保处理完成。 |
容易做错的三处
- 解析大型 PDF 文档时提示超时或内存不足,原因是
PARSE_FILE_TIMEOUT_SECONDS配置过低或系统资源不足,未能处理完数千页的报告。 - 表格或图表中的数据未被正确提取,导致后续检索结果不完整,原因在于
表单识别或图片OCR功能未启用或解析器版本不支持。 - 检索结果中关键术语的上下文缺失,例如 QALY 值与对应的成本数据被分在不同块中,原因是
分段长度设置过短,或未启用父子分块导致逻辑结构丢失。
怎么确认配好了
- 选取几份典型且具有代表性的药物经济学文档(如成本效益分析报告),上传并观察解析状态是否成功。
- 检查知识库中解析后的分块内容,重点核查表格数据、图表说明和关键指标是否被完整提取。
- 对解析后的分块进行关键词检索,验证相关信息是否能被准确召回,并评估召回结果的上下文完整性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。