这个品类的数据长什么样
CMC (Chemistry, Manufacturing, and Control) 研究在药物警戒领域的文档通常涉及药物的生产工艺、质量控制、稳定性测试及批次放行等核心信息。数据来源主要是内部研发报告、生产记录、质量标准文件、批生产记录、变更控制文档以及监管机构提交资料。这些文档更新频率相对较低,通常在药物研发阶段完成或有重大工艺变更时更新。文档结构以结构化表格、半结构化文本和图表混排为主,例如批次信息表、检测结果报告、设备校验记录。字段包括批号、生产日期、有效期、检测项目、分析方法、结果、单位(如 ppm、mg/mL、%)、限度、偏差说明等,数据量庞大且专业性强。
这些特征在「文档解析与分块」这一环带来什么约束
CMC 研究文档的结构化和半结构化特性决定了传统文本分段方式的局限性,需要更精细的解析策略。图表混排要求文档解析工具具备图像识别与表格结构识别能力,否则关键数据可能丢失。低更新频率意味着初期投入的解析配置需要长期稳定运行,但一旦遇到文档格式微调,则需快速响应调整。字段与单位的专业性要求分块后能保留上下文的完整性,避免因截断导致数据含义模糊或单位丢失。例如,批号、检测结果及其对应的单位和限度通常构成一个完整的语义单元,不应被随意拆分。对生产记录等文档,时间序列和批次关联性是重要约束,分块时需要考虑如何维护这些关联。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾语义完整性和召回效率,避免过长导致信息冗余,过短则上下文缺失。 |
分段重叠长度 | 50–100 字符 | 确保分段边界处的语义连续性,尤其在表格或长句连接处。 |
是否启用表格识别 | 启用 | CMC 文档中大量包含批次信息、检测结果等表格数据,必须识别。 |
是否启用图像文本识别 | 启用 | 部分关键信息可能以图片形式存在,如结构式、图表,需提取文本。 |
文件解析超时时间 | 600 秒 | 处理大型 PDF 或包含复杂表格、图像的文档时,解析时间可能较长。 |
最大文件大小 | 200 MB | CMC 报告通常包含大量数据和图表,文件体积较大。 |
容易做错的三处
- 上传的文档中部分表格数据未被解析出来,或表格内容被误判为普通文本。这通常是由于文档解析器对复杂表格结构或图片中的表格识别能力不足,或未启用表格识别功能。
- 解析后的知识库中,关键的批号、检测结果与对应的单位或限度出现断裂,导致查询时无法获取完整信息。这往往是
分段长度设置过短,未能将完整的语义单元保留在同一分块中。 - 上传 HTML 格式的 Javadoc 或其他接口文档后,发现内容为空或解析不完整。这是因为 HTML 文件结构复杂,解析器可能未能正确提取有效文本内容,或将其视为普通文本处理,忽略了标签语义。
怎么确认配好了
- 随机抽取 5–10 份代表性 CMC 文档,上传并检查解析后的分块内容,确保关键表格数据、图表中的文本以及专业术语和单位完整无误。
- 针对包含复杂表格的文档,验证解析结果中的表格行与列是否正确对应,数据是否与原始文档一致。
- 进行模拟查询,使用包含批号、检测项目、结果范围等关键词的自然语言提问,检查召回的分块是否准确、相关且语义完整。
- 检查知识库中不同批次、不同生产环节的文档分块,确保它们能正确关联和区分,避免不同批次数据混淆。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。