这个品类的数据长什么样
抗体偶联药物(ADC)研发文档数据来源广泛,包括临床前研究报告、临床试验方案与报告、药品注册申报资料、专利文献以及内部研发笔记。这些文档通常以 PDF、Word、Excel 等格式存在。数据更新频率高,尤其是临床试验阶段,可能每周或每月发布新的数据更新或修订。文档结构复杂,常包含大量图表、化学结构式、实验流程图和生物学数据。字段方面,涉及靶点信息、偶联技术、载荷分子、连接子、药物剂量、PK/PD 数据、安全性指标等,其中不乏专业术语和缩写。单位体系多样,例如药物浓度使用 nM、µg/mL,剂量使用 mg/kg,时间单位包括小时、天、周等,生物活性数据可能以 EC50、IC50 等形式呈现。
这些特征在「文档解析与分块」这一环带来什么约束
ADC 研发文档的复杂结构对文档解析提出了挑战。图表、化学结构式等非文本内容需要特殊处理,以确保信息不丢失或被错误解析。高频的数据更新要求解析系统具备高效的增量更新能力,避免重复解析大量不变内容。专业术语和缩写的大量存在,使得通用分词策略可能无法准确识别关键概念,影响后续的信息检索质量。多样的单位体系要求解析过程能识别并标准化这些单位,以便进行准确的数据比较和分析。此外,文档中常见的嵌套表格和多列布局,对文本块的边界识别和语义关联性保持提出了更高要求,避免将不同逻辑单元的内容混淆。这些约束决定了文档解析与分块需要更精细化的策略。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾语义完整性和检索效率,避免单个分段过长导致信息冗余或过短导致上下文缺失。 |
重叠长度 | 100–150 字符 | 确保上下文的连续性,减少因分段边界切割而造成的语义断裂。 |
PDF增强 | 勾选 | 处理 ADC 研发文档中常见的复杂布局、图表和化学结构式。 |
图片OCR | 勾选,并选择高精度模式 | 识别图片中嵌入的文本信息,如实验数据表格、图注等。 |
最大文件大小限制 | 500 MB | 适应大型临床试验报告和注册申报资料的存储需求。 |
解析超时时间 | 600 秒 | 应对复杂 PDF 或包含大量图片文档的解析耗时。 |
容易做错的三处
- 文档解析后图片内容丢失或显示为乱码:原因在于未开启或配置
图片OCR导致系统无法识别图片中的文本或将其正确转换为可读格式,或者PDF增强模块未能正确处理嵌入的图像对象。 - 解析后的文本出现大量专业术语被错误分词:原因在于通用分词器对 ADC 领域的专业词汇缺乏训练,未能将如“抗体偶联物”、“载荷分子”等视为一个整体。
- Excel 文档导入后,只解析了第一个 sheet 的内容:原因在于系统默认行为或
Excel解析模式未配置为遍历所有工作表,导致其他 sheet 的关键数据被遗漏。
怎么确认配好了
- 随机抽取不同类型的 ADC 研发文档,观察解析后的文本内容,检查关键信息(如药物名称、靶点、剂量单位)是否完整且无乱码。
- 对比解析前后文档中的图表和化学结构式,确保图片内容中的文本信息通过 OCR 被正确提取,且结构化信息得到保留。
- 检查解析后的分段,评估每个分段的语义完整性,确保一个逻辑单元(如某个实验结果描述)没有被不合理地拆分。
- 导入包含多个 sheet 的 Excel 文档,验证所有工作表的数据都被正确解析并索引。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。