稳定性研究药物警戒的文档解析与分块

稳定性研究数据主要来源于药物的长期、加速和中间稳定性试验报告,这些报告通常以PDF、DOCX或扫描图像形式存在。数据更新频率与批次生产及国家药监部门的年度报

这个品类的数据长什么样

稳定性研究数据主要来源于药物的长期、加速和中间稳定性试验报告,这些报告通常以 PDF、DOCX 或扫描图像形式存在。数据更新频率与批次生产及国家药监部门的年度报告要求相关,通常为季度或年度更新。文档结构相对固定,包含试验批次信息、储存条件(温度、湿度、光照)、检测项目(如含量、溶出度、有关物质、微生物限度)、检测方法、原始数据表格、趋势图及结论。字段包括批号、检测日期、时间点(例如 T=0, 3M, 6M, 12M)、检测结果(数值型,带单位如 %, μg/mL, CFU/g)、限度标准等。单位和检测方法需严格遵循药典或注册标准。

这些特征在「文档解析与分块」这一环带来什么约束

稳定性研究报告的固定结构和大量表格数据,要求文档解析器具备高精度表格识别能力。报告中包含的趋势图和图表,若无法有效提取文本信息,可能导致关键数据缺失。更新频率相对较低,但单次更新可能涉及大量历史数据的比对,对知识库的版本管理和增量更新提出要求。数值型字段和单位的准确识别至关重要,任何解析错误都可能影响后续的药物警戒判断。时间点字段的识别需支持多种表达方式,例如 3个月 或 3M。内网 Confluence 页面若承载了部分稳定性研究规程或标准,其解析能力直接影响知识库的完整性。文本流的单一性,使得前端展示需要更多结构化处理,以提升用户体验。

配置怎么定

配置项建议取法这样取的依据
分段长度800–1200 字符确保单个分块能完整包含一个检测项目的所有相关描述、数据行及结论,避免关键信息被截断。
分段重叠100–200 字符保留上下文关联,尤其在表格跨页或段落衔接处,有助于 RAG 召回时获取更全面的信息。
文件类型白名单['.pdf', '.docx', '.csv', '.xlsx']覆盖稳定性研究报告的主要格式,兼容原始数据和总结报告。
ENABLE_TABLE_EXTRACTIONtrue稳定性研究报告大量数据以表格呈现,启用表格提取是获取核心数据的关键。
maxContext4000 字符确保召回结果能包含多批次或多时间点的对比数据,支持更复杂的查询。
召回条数5 条在保证准确性的前提下,提供足够的对比样本,方便用户进行多维度分析。

容易做错的三处

  • 解析出的表格数据行错位或单元格内容合并,原因是文档中表格线条模糊或存在复杂嵌套表头,导致解析器结构识别不准确。
  • 稳定性趋势图下方的文字描述或结论未被提取,可能是因为图像识别(OCR)未启用或对特定字体、布局兼容性不足。
  • 内网 Confluence 页面内容无法解析,错误代码显示 401 Unauthorized 或 403 Forbidden,原因在于 FastGPT 未配置正确的内网代理或认证信息,无法访问受限资源。

怎么确认配好了

  • 上传典型稳定性研究报告 PDF 文件后,检查知识库中是否正确解析出所有表格数据,特别是批号、检测项目、时间点和数值结果字段是否完整且无错位。
  • 针对包含趋势图和结论的报告,通过检索相关关键词,核对召回结果中是否包含图表下方或附近的文本描述。
  • 尝试解析内网 Confluence 上的稳定性研究规程页面,确认内容能够被正常抓取并添加到知识库。
  • 使用包含特定单位(如 %, μg/mL)的查询,验证系统能否准确召回包含这些单位的检测结果,并核对数值和单位是否匹配。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。