这个品类的数据长什么样
抗体偶联药物(ADC)的质量文档涉及从研发到生产、质检、放行的全生命周期。数据来源多样,包括实验室记录、批生产记录(BPR)、批检验记录(BJR)、稳定性研究报告、供应商资质文件、偏差处理报告、变更控制文件等。这些文档多为结构化与非结构化混合形式,例如 PDF 格式的实验报告、Word 格式的 SOP(标准操作规程),以及部分 LIMS(实验室信息管理系统)导出的 CSV 或 Excel 数据。更新频率取决于药物的开发阶段和生产批次,早期研发阶段可能每周甚至每天有更新,而商业化生产阶段则主要依据批次发布和年度回顾进行。文档中包含大量专业术语、化学结构式、图谱数据、计量单位(如 mg/mL、ug/kg、%、AU)和批次号、有效期等关键字段。
这些特征在「工作流编排」这一环带来什么约束
ADC 质量文档的混合结构对工作流编排提出了挑战。非结构化文本的解析需要强大的语义理解能力,确保关键信息的准确提取。高更新频率要求工作流具备增量处理能力,避免重复解析历史数据,同时确保知识库的实时性。文档中包含的专业术语和图谱数据,要求工作流中的知识库召回和重排模块能有效处理这些特定领域的实体,避免因词汇不匹配导致的召回失败。计量单位和批次号等关键字段的抽取,需要依赖特定的实体识别模型或规则。此外,由于质量文档的严谨性要求,工作流在处理数据时必须确保溯源性,例如记录文档来源、解析时间戳和处理版本,以满足合规性要求。大量文档的解析可能导致长时间运行,工作流需要考虑超时处理和中间状态保存机制。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 适应 ADC 质量文档中段落长度适中、信息密度较高的特点,避免单一分段信息过载或过少。 |
召回条数 | 前 8–12 条 | ADC 质量文档的专业性要求在初次召回时尽可能覆盖潜在相关内容,确保后续重排有足够候选。 |
相似度阈值 | 0.75–0.85 | 保证召回结果与查询意图高度相关,减少不相关的噪音,提高查询准确性。 |
重排返回条数 | 3–5 条 | 经过重排后,精选出最相关的几条信息提供给用户,减少信息过载,提高响应效率。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | ADC 质量文档可能包含大量页面或复杂图表,解析时间可能较长,预留充足时间以防超时。 |
maxContext | 32000 词元 | 应对复杂质量查询中,上下文可能需要包含多个文档片段和对话历史的情况,确保完整性。 |
容易做错的三处
- 现象:模型回复中关键批次号或实验数据缺失。原因:工作流中实体识别模块未能准确识别文档中的特定格式数据,导致信息提取失败。
- 现象:用户提出关于最新批次质量报告的查询,但回复内容是旧版本信息。原因:文档解析模块未配置增量更新策略,或知识库未及时同步最新上传的文档。
- 现象:工作流在处理包含大量图表和扫描件的 PDF 文档时频繁报错或超时。原因:文档解析器对非文本内容的处理能力不足,或未配置足够的处理时间,导致解析任务中断。
怎么确认配好了
- 通过上传典型的新批次质量报告,检查知识库中是否包含最新更新的关键字段和数据,并进行查询测试,验证召回结果的时效性。
- 使用包含特定计量单位和专业术语的查询语句,核对模型回复中这些信息的准确性和完整性,确保实体识别和抽取无误。
- 针对不同结构(如纯文本 SOP、带图谱的实验报告 PDF)的 ADC 质量文档进行解析测试,观察工作流执行状态,确认无超时或解析失败报错。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。