这个品类的数据长什么样
抗体偶联药物(ADC)的质量文档具有高度结构化和专业化的特点。数据主要来源于药物研发、生产、质控及注册申报过程中产生的文件,包括批生产记录、检验报告、稳定性研究报告、质量标准、验证方案与报告等。这些文档的更新频率取决于药物的研发阶段和生产批次,例如批生产记录随每批产品更新,质量标准可能在工艺变更后修订。文档结构通常遵循ICH Q7、Q8、Q9、Q10等指导原则,包含明确的章节划分、图表、附录。字段方面,涉及抗体、连接子、小分子毒素的理化性质、纯度、含量、杂质、偶联率、DAR值等关键质量属性,单位精确到微克/毫升、毫摩尔/升、百分比、OD值等。
这些特征在「文档解析与分块」这一环带来什么约束
ADC质量文档的高度结构化和专业性,对文档解析与分块提出了特定要求。首先,文档中包含大量表格和图谱数据,需要解析器能够准确识别表格边界和内容,并提取图谱中的关键信息。其次,专业术语和缩写密集,例如“DAR”、“HPLC”、“MS”,这要求分块时能保持术语的完整性,避免因断词导致语义丢失。再次,关键质量属性数据(如纯度、含量)通常以数值和单位对的形式出现,分块时需确保数值与单位的关联性。最后,法规符合性要求使得文档中存在大量交叉引用和版本控制信息,解析时需保留这些关联,以便后续追溯和验证。传统基于通用文本的分块方法可能无法有效处理这些复杂结构和专业内容。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾单个知识块的完整性与查询效率,避免过长文本稀释关键信息。 |
分段重叠 | 100–150 字符 | 确保段落间上下文衔接,特别是在表格或关键描述跨页时。 |
解析模式 | 高级模式(表格增强) | ADC质量文档中大量表格数据需要专门的表格解析能力。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 针对大型PDF文档,如批生产记录,预留充足解析时间,避免超时中断。 |
chunk_strategy | 按标题和段落分段 | 质量文档通常有清晰的章节标题,按此策略能保持内容逻辑完整性。 |
容易做错的三处
- 上传大型PDF文件时,系统日志显示
文件解析超时。原因:PARSE_FILE_TIMEOUT_SECONDS参数设置过低,未能覆盖大型批生产记录或稳定性报告的解析时长。 - 在检索结果中,ADC药物的某个关键质量属性(如“偶联率”)的数值与单位分离,或表格数据未能有效提取。原因:文档解析器未开启或配置正确的表格增强模式,导致结构化数据解析失败。
- 通过API上传文件时,指定的PDF解析参数未生效,文件仍然以默认方式处理。原因:API调用中
file_parser或相关解析策略参数未正确传递或参数名不匹配,导致系统未能识别自定义解析指令。
怎么确认配好了
- 上传一份包含复杂表格和图谱的ADC质量文档,检查其在知识库中的预览效果,确认表格结构和关键数据是否完整保留。
- 针对文档中的核心专业术语和关键质量属性,进行检索测试,验证检索结果中返回的知识片段是否包含完整的术语定义或数值-单位对。
- 上传一个典型的ADC批生产记录PDF,观察文件上传和解析过程是否顺畅,检查系统日志中是否存在解析相关的错误或警告信息。
- 对知识库中的某个ADC文档进行编辑,查看其分段情况,判断分段是否符合预期,例如关键段落未被不合理截断。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。