这个品类的数据长什么样
抗体偶联药物(ADC)临床试验预筛的数据主要来源于申办方、CRO 公司及研究机构提供的临床试验方案、研究者手册、受试者知情同意书、病例报告表(CRF)、医学影像报告和实验室检测结果。这些文档通常以 PDF 格式为主,部分为 Word 或结构化数据文件。更新频率较高,尤其在试验方案修订、安全性报告更新时。文档结构复杂,包含大量专业术语、缩写、图表和表格。字段与单位具有高度特异性,例如抗体-药物偶联比(DAR)、有效载荷(payload)类型、连接子(linker)特性、药物剂量单位(mg/kg)、治疗周期(天/周),以及与肿瘤类型、生物标志物相关的特定表达水平(如 IHC 评分、FISH 结果)。
这些特征在「文档解析与分块」这一环带来什么约束
ADC 临床试验文档的复杂结构和专业性对文档解析与分块提出了独特挑战。大量的表格和图表,特别是剂量爬坡、药代动力学(PK)数据和药效学(PD)数据,需要精确识别其边界和内部结构,避免将表格内容错误地切割或合并。专业术语和缩写的高密度要求分块时能保持上下文的完整性,避免因断裂导致语义理解偏差。例如,一个关于“抗体-药物偶联比”的段落不应在“偶联比”一词中间被截断。此外,频繁的文档更新意味着需要支持增量解析和高效的版本管理,确保更新内容能被准确识别和整合,而不会重复解析已有内容。字段与单位的特异性,例如“µg/mL”与“ng/mL”的区分,要求分块后仍能保留其原始精度和上下文,便于后续的信息提取和匹配。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800-1200 字符 | ADC 临床文档段落通常较长,包含复杂描述,该长度有助于保持语义完整性,避免关键信息被切割。 |
分段重叠长度 | 150-200 字符 | 确保相邻分块间有足够的上下文衔接,特别是在专业术语和缩写密集区域,减少信息丢失风险。 |
自定义分隔符 | \n\n | 临床文档中段落间通常使用双换行符分隔,可有效识别自然段落边界。 |
解析表格 | 开启 | ADC 文档中存在大量剂量、PK/PD 数据表格,开启可确保表格内容被正确解析为独立分块。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 大型临床试验方案文档解析时间较长,适当延长超时时间可避免解析中断。 |
PDF_MARKER_ENABLED | true | 启用 PDF Marker 可提升复杂 PDF 文档,尤其是扫描件和多列布局的解析准确性。 |
容易做错的三处
- 解析结果出现大量不完整或语法错误的短句,原因是对文档中的表格或多列布局处理不当,导致文本流被错误地拼接。
- 上传大型 PDF 文档后长时间无响应或报错
504 Gateway Timeout,原因可能是PARSE_FILE_TIMEOUT_SECONDS设置过短,无法完成复杂文档的解析。 - 知识库查询时无法召回特定关键信息,现象是字段为空或不匹配,原因是对包含专业术语和单位的段落分块过细,破坏了其原始语义上下文。
怎么确认配好了
- 随机抽取 5-10 份 ADC 临床试验方案、研究者手册和病例报告表,检查其解析后的文本分块是否完整,无明显语义断裂或错位。
- 验证解析后的分块中,表格内容是否被正确识别为独立的、结构化的分块,并能保留其行、列关系。
- 通过搜索特定 ADC 相关专业术语(如“Trastuzumab deruxtean”、“DAR 值”、“ADC 偶联位点”)和关键单位(如“mg/kg”、“µg/mL”),确认包含这些信息的段落能被完整保留在一个或少数几个相关分块中。
- 比对原始文档与解析结果,确认标题、副标题以及重要列表项是否被正确识别,并作为独立的语义单元进行分块。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。