这个品类的数据长什么样
CMC 研究的数据主要来源于药学研究报告、质量标准、生产工艺文件、稳定性研究报告以及注册申报资料等。这些文档通常以 PDF 格式为主,部分数据可能嵌入在扫描件或图片中。数据的更新节奏与药品的研发阶段紧密相关,从临床前研究到上市后的变更,数据会持续产生和修订。文档结构复杂,包含大量表格、图谱、流程图和专业术语,例如“批次号”、“主成分含量”、“杂质谱”、“溶出度”、“稳定性数据”等,并严格遵循药典或 ICH 等国际指导原则的单位体系。字段的命名往往高度标准化,但不同药企或不同产品之间仍可能存在细微差异。
这些特征在「文档解析与分块」这一环带来什么约束
CMC 研究文档的复杂结构和专业性对文档解析提出了高要求。内嵌的表格和图谱需要精确识别和提取,否则会丢失关键的定量信息。扫描件中的文本识别准确率直接影响后续知识库的质量。频繁的数据更新和修订要求知识库能够有效处理版本迭代,避免旧数据干扰。高度标准化的字段和单位,以及特有的专业术语,需要解析器具备领域词汇的理解能力,以确保分块的语义完整性。例如,一个关于“稳定性数据”的段落,不能被拆分成只包含“稳定性”或“数据”的片段,必须保持其作为一个整体的含义,才能在预筛中有效匹配。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | CMC 文档常包含大量图片和图谱,文件体积较大,需要足够的上传上限。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 复杂 PDF 文档的解析,尤其是 OCR 识别,耗时较长,避免解析超时。 |
segment_length | 800–1200 字符 | 确保每个分块包含足够的上下文信息,同时避免单个分块过长导致语义分散。 |
overlap_rate | 0.15–0.2 | 适度的重叠有助于在分块边界处保留语义连续性,提高召回率。 |
chunk_strategy | 按标题和段落分块,并优先表格解析 | CMC 文档结构化程度高,优先保留标题和段落的完整性,并确保表格数据被正确识别。 |
ocr_engine_config | 高精度模式,支持多语言(中文/英文) | 提升扫描件和图片中文字的识别准确率,应对中英文混合的专业术语。 |
容易做错的三处
- 处理 PDF 文件时报错并显示
{"detail":"错误信息: ...":通常是由于底层 PDF 解析器(如 Marker)未正确安装或配置,或者文件本身损坏导致解析失败。 - 知识库查询结果中,表格数据无法被有效召回或内容缺失:表明文档解析器未能正确识别并提取 PDF 中的表格结构,导致表格内容在分块时被忽略或错误拆分。
- 回答中未能溯源到原始文档或溯源信息不准确:这可能是因为分块粒度过大或过小,导致某个回答依赖的信息分散在多个分块中,或者分块中缺乏足够的元数据关联原始文档。
怎么确认配好了
- 上传一批典型的 CMC 研究报告 PDF 文件,检查知识库中是否能够正确显示文档的页数和基本结构信息。
- 随机抽取文档中的关键表格,通过知识库的预览功能验证表格内容是否被完整且正确地解析并分块。
- 针对文档中的专业术语、批次号或关键定量数据进行知识库检索,检查召回的分块内容是否完整且语义准确,并确认溯源信息能指向正确的文档和页码。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。