这个品类的数据长什么样
药物经济学领域的文档数据主要来源于国家医保局、卫健委、各省市药采平台发布的政策文件、药械集中采购文件,以及药企提交的药物经济学评估报告。这些文档更新频率较高,特别是医保目录调整、药品集采方案发布时。文档结构复杂,常包含大量表格、图表、引用文献和统计数据。字段方面,涉及药品通用名、剂型、规格、医保支付标准、采购价格、药物成本、疗效指标(如 QALY、LYG)、成本效益比(ICER)、敏感性分析参数等,单位多样,包括人民币、美元、年、月、克、毫克等。
这些特征在「文档解析与分块」这一环带来什么约束
药物经济学文档的表格数据密集,传统文本分块方式容易破坏表格的完整性,导致关键数值和单位脱节。政策文件更新频繁,要求知识库能够快速识别并整合新版本中的修订内容,避免旧信息干扰。复杂的文档结构,特别是嵌套表格和图表说明,对文档解析器的识别能力提出挑战,需要确保这些非文本元素能被正确关联到其上下文。字段多样性和单位混杂,要求分块后的小片段仍能保持其语义完整性,例如,一个关于“某药品年治疗费用为 12000 元”的片段,不能被拆分成“12000”和“元”在不同块中,从而影响后续检索的准确性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 确保包含完整的句子和段落,同时避免单个分块过大稀释信息密度,适用于表格行数据。 |
分段重叠长度 | 150–200 字符 | 保证上下文连续性,特别是跨表格或段落边界的语义连接。 |
CHUNK_STRATEGY | 按标题分块 和 按表格分块 组合 | 优先保持药物经济学报告中章节逻辑和表格数据的完整性。 |
UPLOAD_FILE_MAX_SIZE | 500 MB | 应对包含大量图表和高分辨率图片的药物经济学评估报告文件大小。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 允许复杂 PDF 文件(含嵌入字体和图表)有足够的解析时间。 |
PDF_OCR_ENABLED | True | 确保扫描版政策文件和报告中的非文本内容可被识别和索引。 |
容易做错的三处
- 文档上传后,表格数据被错误解析,检索结果中数值与单位不匹配。原因在于默认分块策略未充分考虑表格结构,导致行或列数据被拆散。
- 新发布的政策文件上传后,知识库未能有效更新,检索时仍返回旧版本信息。原因在于未启用版本管理或增量更新功能,旧数据未被新数据有效覆盖。
- PDF 文件上传后,部分内容无法检索,日志显示
marker-pdf parse error或connection refused。原因在于marker-pdf服务未正确部署或配置,无法访问本地或远程的 PDF 解析服务。
怎么确认配好了
- 上传一份包含复杂表格和图表的药物经济学报告,检查分块预览,确保表格的每一行数据(包含数值和单位)能作为一个或几个连续的块被保留。
- 上传一份新旧版本对比明显的政策文件,检索其中有修订的关键条款,确认返回的是新版本中的内容。
- 随机抽取知识库中 5-10 份文档,对文档中的关键术语、药品名称、价格数据进行精确检索,检查返回结果的准确性和完整性。
- 模拟用户提问关于药物经济学评估报告中的成本效益比或敏感性分析结果,验证回答中是否能准确引用源文档的关键数据和结论。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。