这个品类的数据长什么样
减毒灭活疫苗产品的数据主要来源于药品说明书、临床试验报告、生产工艺规程、质量标准、药监部门审批文件以及学术期刊论文。这些文档通常以 PDF 格式为主,部分数据可能以 Word 文档、Excel 表格或扫描件形式存在。更新频率方面,药品说明书和质量标准会随审批变更或上市后研究结果进行修订,周期从数月到数年不等;临床试验数据则在不同阶段逐步公开。文档结构上,说明书具有高度标准化的章节划分,如【适应症】、【用法用量】、【不良反应】等;临床报告则包含【研究背景】、【方法】、【结果】、【讨论】等。字段与单位方面,涉及剂量(如 μg、IU)、浓度(如 TCID50/ml)、批次号、有效期(如 月)、温度(如 ℃)等,且常伴有图表,如疫苗效价曲线、免疫原性数据图、生产流程图。
这些特征在「文档解析与分块」这一环带来什么约束
减毒灭活疫苗文档的标准化章节结构,为基于标题层级的逻辑分段提供了基础,需要解析器能准确识别并保持原文的层级关系。PDF 格式的普遍性要求解析工具具备强大的 PDF 解析能力,尤其是对内嵌表格和图片的抽取,确保关键数据不丢失。更新频率的不确定性,意味着解析系统需支持增量更新,并在数据源发生变化时自动触发重新解析。文档中常见的剂量、浓度等专业字段,以及各类单位,要求解析后的文本能够准确保留这些信息,避免因误识别或格式转换导致的语义偏差。此外,大量图表的存在,特别是内嵌在 PDF 中的图片,需要特殊的处理机制,如提取图片并进行文字识别,或生成图片摘要,以确保大模型能够获取图表中的非文本信息。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 确保单个分段能包含疫苗相关完整概念,避免跨段割裂;适度长度利于大模型理解上下文。 |
分段重叠度 | 100–150 字符 | 保证上下文连续性,尤其在说明书和临床报告的关键信息点之间,减少信息丢失风险。 |
解析模式 | 智能分段 | 针对说明书、临床报告等结构化文档,智能模式能更好地识别章节和段落边界。 |
图片OCR | 启用 | 疫苗文档中常有关键图表,如免疫原性曲线、生产流程图,OCR能提取图片中的文本信息。 |
表格解析 | 启用 | 剂量、批次、效价等关键数据常以表格形式呈现,确保表格内容被正确解析和结构化。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型临床试验报告或包含大量图片、表格的复杂 PDF 文件,防止解析超时。 |
容易做错的三处
- 解析结果中关键剂量、批次号等数值信息缺失或格式错误,原因在于解析器对特殊字符或单位的识别能力不足,或未启用表格解析导致表格数据丢失。
- 大模型在回答中无法提及文档中的图表内容,现象是回答仅基于文本信息,原因在于图片未被正确提取并进行光学字符识别(OCR),或图片摘要功能未启用。
- 文档更新后,旧的疫苗信息仍然被召回,原因在于未配置增量更新机制,或新版本文档未触发重新解析和索引。
怎么确认配好了
- 随机抽取不同类型的减毒灭活疫苗文档,检查解析后的文本是否完整保留了【适应症】、【用法用量】、【不良反应】等核心章节内容,并核对关键数值与单位的准确性。
- 上传包含表格和图片的文档,验证解析结果中表格数据是否结构化且内容无误,并检查图片中的文本信息(如坐标轴标签、图例文字)是否通过 OCR 正确识别。
- 修改一份已上传文档中的关键信息(如有效期),重新上传后,通过检索功能确认召回结果已更新为最新版本,旧版本信息不再出现或被标记为过期。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。