这个品类的数据长什么样
稳定性研究数据主要来源于药物稳定性考察实验报告、批生产记录、检验报告以及相关法规文件。这些数据通常以结构化表格(如 Excel、CSV)和非结构化文本(如 Word、PDF 格式的实验方案、总结报告)混合存在。更新节奏通常与批次生产、年度回顾或注册申报周期相关,可能为季度、半年或年度更新。文档结构复杂,包含大量专业术语、缩写、化学式和图表。字段涵盖温度、湿度、批号、生产日期、有效期、检测项目(如含量、溶出度、杂质)、检测结果、单位(如 %、mg/mL、ppm)及统计学分析数据。部分数据可能以扫描件形式存在。
这些特征在「文档解析与分块」这一环带来什么约束
稳定性研究文档的混合数据类型要求文档解析器具备多模态处理能力,特别是对扫描版 PDF 中表格和图表的识别。更新节奏决定了知识库需要支持增量更新和版本管理,以确保申报资料的时效性。复杂的文档结构和专业术语,如“降解产物”、“贮藏条件”、“加速试验”,要求分块策略能够识别并保持相关信息的完整性,避免因过度切分导致语义丢失。例如,一个实验结果表格不应被拆分成多块。字段和单位的准确识别是后续信息提取的关键,尤其对于数值型数据,单位的正确关联直接影响结果的可用性。图片形式的检测曲线或结构式解析,需要特定的 OCR 和图像识别能力。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾语义完整性与召回效率,避免长段落信息过载。 |
分段重叠 | 100–200 字符 | 确保上下文连续性,尤其在表格或图表描述跨页时。 |
文件类型 | PDF, DOCX, XLSX, JPG, PNG | 覆盖稳定性研究报告常见的文档和图像格式。 |
解析模式 | 智能分段,并开启表格识别 | 应对混合文本和表格数据,提高表格数据解析准确性。 |
OCR 精度 | 高 | 针对扫描版报告和图片中的文字,提高识别准确率。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型或复杂文档的解析时间,防止超时导致失败。 |
容易做错的三处
- 现象:上传 PDF 文件后,表格数据未被正确识别,或表格行被错误地切分到不同块中。原因:未开启或配置正确的表格识别功能,或
分段长度设置过短导致表格结构被破坏。 - 现象:解析日志显示
Unsupported file type错误,即便文件是常见的图片格式。原因:系统未安装或未启用相应的图像处理插件,或文件扩展名与实际内容不符。 - 现象:包含化学式或专业缩写的文本块在检索时召回率低。原因:
分段长度过短,导致包含完整语义的专业术语被拆散,向量化时语义信息分散。
怎么确认配好了
- 上传典型稳定性研究报告的 PDF 文件,检查解析后的知识块内容,特别是表格和图表描述是否完整且语义连贯。
- 随机抽取解析后的知识块,检查其中包含的数值型数据及其
单位是否被正确提取和关联。 - 使用报告中的关键专业术语和缩写进行知识库检索,评估召回结果的准确性和相关性,根据召回效果调整
相似度阈值。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。