这个品类的数据长什么样
CMC(化学、制造与控制)研究的注册申报资料,其数据主要来源于药品研发、生产过程中的实验报告、质量标准、生产工艺规程、稳定性研究报告等内部文档。这些资料通常以 PDF、Word、Excel 等多种格式存在,更新频率与研发阶段紧密相关,从临床前研究到上市后的变更申请,都可能触发资料的更新。文档结构高度规范化,遵循 ICH Q 系列指导原则及各国药监部门的要求,例如 CTD 格式。数据字段包含化学结构信息、理化性质、生产批次、纯度、杂质谱、含量、溶出度等,单位涉及百分比(%)、毫克(mg)、微克(µg)、摄氏度(℃)、pH 值、时间单位(小时、天、月)等,精确性要求极高。
这些特征在「文档解析与分块」这一环带来什么约束
CMC 资料的规范化结构要求解析时能准确识别章节层级与内容归属,尤其是表格、图表中的数据。PDF 文档中常包含扫描件,需要 OCR 技术确保文本可读性,同时保留原始图片以供上下文参考,避免信息丢失。Excel 文件中的多 sheet 结构,意味着解析器需能区分并提取不同标签页的数据。数据的高精确性要求解析结果不能有数值偏差或单位混淆。更新频率不定,要求系统具备增量更新能力,能快速识别并处理变更部分。此外,大量专业术语和缩写,对分词和实体识别提出了挑战,需要更精细的文本处理策略,以确保知识库召回的准确性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | CMC 资料单文件可能较大,包含高分辨率图片与大量表格 |
分段长度 | 800–1200 字符 | 兼顾 CMC 资料的段落完整性与检索效率,避免切断重要信息 |
分段重叠 | 100–200 字符 | 确保上下文连续性,尤其在跨段落引用或解释时 |
PDF_OCR_ENABLED | true | 处理 PDF 扫描件和图片内嵌文本,保证内容全面可搜索 |
PARSE_TABLES_AS_TEXT | true | 将表格内容转换为文本,便于模型理解和检索结构化数据 |
SHEET_NAME_TAGGING | true | 标识 Excel sheet 名称,区分不同标签页的数据来源与上下文 |
容易做错的三处
- 文档解析后,图片内容丢失或仅剩 OCR 文本,无法查看原始图表。原因是未配置图像保留或图片处理模式不当。
- Excel 文件导入后,不同
sheet页的数据混淆,或无法单独检索特定标签页的内容。原因是解析器未能有效识别并区分 Excel 文件的多sheet结构。 - 解析后的文档分块不合理,导致检索时上下文缺失或信息碎片化。原因是
分段长度设置过短或未充分考虑 CMC 资料的章节逻辑。
怎么确认配好了
- 随机抽取多类型 CMC 申报资料,上传并检查解析后的文本内容是否完整,尤其是图表、表格和专业术语。
- 选择包含多个 Excel
sheet的文件进行导入,验证知识库中是否能通过sheet名称进行精确检索。 - 对照原始文档,检查解析后文本的章节结构、段落边界,确保
分段长度和分段重叠设置能有效保留语义完整性。 - 通过 FastGPT 的知识库检索功能,输入 CMC 资料中的特定数据点或关键词,验证召回结果是否准确且包含必要的上下文信息。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。