抗体偶联药物 ADC注册申报资料准备的文档解析与分块

抗体偶联药物(ADC)的注册申报资料涉及多模态数据,其核心是临床前研究报告、临床试验报告和生产工艺文件。数据来源多样,包括实验室分析报告、合同研究组织(CR

这个品类的数据长什么样

抗体偶联药物(ADC)的注册申报资料涉及多模态数据,其核心是临床前研究报告、临床试验报告和生产工艺文件。数据来源多样,包括实验室分析报告、合同研究组织(CRO)提交的临床数据以及内部生产批记录。更新节奏通常与药物研发阶段同步,例如临床试验数据会阶段性更新,生产工艺数据在工艺优化后更新。文档结构复杂,常见为PDF格式的CTD(通用技术文件)模块,内部包含大量嵌套表格、图谱(如质谱、色谱)和生物学序列信息。字段和单位具有高度专业性,例如药代动力学(PK)参数的 Cmax、AUC,毒理学中的 NOAEL,以及抗体浓度单位 μg/mL 和偶联比(DAR)等,这些都需要精确识别。

这些特征在「文档解析与分块」这一环带来什么约束

ADC申报资料的复杂性对文档解析与分块提出了特殊要求。首先,PDF中嵌套表格和图谱的存在,使得传统基于文本的分块策略可能丢失关键信息,需要强化表格结构识别和图像OCR能力。其次,专业字段和单位的精确识别对后续信息抽取和知识图谱构建至关重要,一旦解析错误,可能导致数据关联性问题。高频次的更新意味着知识库需要支持增量更新和版本管理,分块策略需考虑如何高效识别和整合新旧数据。此外,CTD模块的层级结构要求分块时能保留文档的逻辑层级关系,例如将同一研究的多个子报告保持关联,避免语义碎片化。

配置怎么定

配置项建议取法这样取的依据
分段长度800–1200 字符兼顾语义完整性和检索效率,避免过长导致信息冗余,过短导致上下文缺失。
分段重叠100–200 字符确保分块边界的语义连续性,尤其在表格和图谱描述文本中。
文件类型白名单pdf, docx, xlsx, txt覆盖ADC申报资料的主要文件格式,确保所有相关文档都能被处理。
表格解析模式结构化提取针对ADC报告中大量药理毒理数据表格,确保数据以结构化形式保存。
PARSE_FILE_TIMEOUT_SECONDS600 秒考虑到大型CTD文件解析耗时较长,预留充足时间避免解析中断。
OCR_ENABLEDTrueADC文档中常包含扫描件或图谱,开启OCR以识别图像中的文本信息。

容易做错的三处

  • 现象:知识库检索结果中表格数据缺失或错位。原因:未启用或配置正确的表格解析模式,导致表格内容被视为普通文本,结构信息丢失。
  • 现象:上传飞书在线表格后,知识库未能正确识别其内容。原因:系统默认的文件解析器可能不支持在线文档的实时同步或特定API接口,需要通过Webhook或导出为标准文件格式再上传。
  • 现象:分块后检索到的信息上下文不完整,导致AI回答逻辑跳跃。原因:分段长度设置过小,或未考虑文档的章节逻辑,导致语义相关的内容被拆分到不同块中。

怎么确认配好了

  • 上传典型ADC申报资料PDF,检查解析后的文本块是否完整保留了表格、图谱的描述性文本和关键数据。
  • 针对包含专业术语和单位的文档,进行关键词检索,验证是否能准确召回包含这些信息的文本块。
  • 上传一份更新过的文档,检查知识库是否能识别增量内容,并将其与原有知识进行有效关联。
  • 随机抽取几个分块,人工阅读其内容,评估其语义完整性,确保每个分块都包含一个相对独立且有意义的信息单元。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。