这个品类的数据长什么样
抗体偶联药物(ADC)产品的数据源多样,主要包括官方药品说明书、临床试验报告、研究论文、专利文献以及药品监管机构发布的公开数据库。这些文档的更新频率取决于药物的研发、审批和上市后监测进展。例如,临床试验数据会随着试验阶段推进而定期发布更新,药品说明书则可能根据不良反应监测或适应症扩展进行修订。文档结构上,ADC产品数据通常包含高度结构化的信息,如药物成分、作用机制、药代动力学、药效学、适应症、用法用量、不良反应、禁忌症等。其中,成分信息会涉及抗体、连接子和细胞毒性药物的具体分子结构与CAS号;药代动力学数据包括半衰期、清除率等;药效学数据则涉及结合亲和力、肿瘤抑制率等定量指标。单位方面,剂量常用毫克(mg)或毫克/千克(mg/kg),浓度常用微克/毫升(µg/mL)或纳摩尔(nM),时间单位为小时(h)或天(d),体积单位为毫升(mL)。
这些特征在「文档解析与分块」这一环带来什么约束
ADC产品文档的数据多样性与结构化特点,对文档解析与分块提出了特定要求。首先,大量表格和图表的存在,尤其是临床试验结果和药代动力学数据,要求解析器具备强大的表格内容识别与结构化提取能力,以避免数据错位或丢失。其次,分子结构式和化学名称的频繁出现,意味着需要支持专业的化学实体识别,防止这些关键信息被错误地分词或截断。第三,不同来源文档的更新频率差异,例如临床研究进展的快速更新,要求知识库能够高效识别并处理增量数据,确保信息的时效性。第四,ADC产品说明中常包含复杂的专业术语和缩写,分块时需保证上下文的完整性,避免因过度切分导致语义丧失。最后,药代动力学和药效学数据中的数值与单位紧密关联,分块时必须保持数值与对应单位的邻近性,否则可能导致数据误读或计算错误。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾复杂专业术语的上下文完整性与检索效率,避免过长文本导致信息冗余。 |
分段重叠长度 | 100–150 字符 | 确保跨段落信息的连续性,尤其在描述作用机制、药代动力学过程时。 |
文件类型白名单 | pdf, docx, xlsx, txt, json | 覆盖ADC产品常见文档格式,特别是PDF和DOCX用于说明书和报告,XLSX用于实验数据。 |
表格识别模式 | 自动识别并结构化 | 针对临床试验报告和药代动力学数据中的大量表格,确保数据精准提取。 |
OCR语言 | 中文, 英文 | 应对全球范围内的研究文献和药品说明书,确保多语言内容的识别准确性。 |
解析超时时间 | 600 秒 | 考虑到大型临床报告或含有大量图片/表格的文档解析可能耗时较长。 |
容易做错的三处
- 解析日志显示“slow operation xxxxms”,MongoDB响应慢,原因是文件体积过大或包含复杂表格,导致解析器处理时间超出预期。
- 上传DOCX文件后,返回结果中图片内容显示为“Invalid image file”,现象为解析器未能正确识别并处理嵌入的图片数据,图片信息未被提取或转换为文本。
- 模型输出的Markdown表格内容被截断,原因是分段长度设置过小,导致单个表格被切分到多个段落,或单段文本超出模型输入长度限制。
怎么确认配好了
- 上传包含复杂表格的PDF药品说明书,检查解析后的文本是否完整保留表格结构和数据,并进行随机抽样比对。
- 上传含有分子结构图的专利文献,验证图片描述或相关文本是否被准确提取,确认关键化学实体未被错误切分。
- 上传更新版本的临床试验报告,检查增量数据是否被正确识别并更新到知识库中,同时核对关键药代动力学参数是否保持数值与单位的关联。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。