这个品类的数据长什么样
抗体偶联药物(ADC)的注册申报资料,其数据源多样且复杂。包括但不限于临床前研究报告(药理毒理、药代动力学)、CMC(化学、制造与控制)文件、临床试验方案、研究者手册、临床研究报告、统计分析计划以及上市后风险管理计划等。这些数据更新频率较高,尤其在临床试验阶段,数据会随着试验进展持续产生和修订。文档结构通常遵循ICH指导原则,如CTD格式,分模块组织。字段涵盖分子结构、纯度、稳定性、体内外药效、安全性指标(如 AUC、Cmax、LD50)、临床疗效终点(ORR、PFS、OS)等,单位涉及 mg/kg、µg/mL、nM、天、月、年,且常包含复杂的生物学和统计学专业术语。
这些特征在「部署与升级」这一环带来什么约束
ADC申报资料的复杂数据特性,对FastGPT的部署与升级提出特定要求。首先,数据量大且更新频繁,要求底层存储具有高吞吐量和可扩展性,并能支持快速索引更新,以应对临床数据滚动录入和版本迭代。其次,多样的文档格式(PDF、Word、Excel、图像等)和嵌套结构,需要强大的文件解析能力和智能分段策略,确保信息提取的准确性和完整性。特别是针对含有大量图表和生物序列信息的文件,需避免解析错误或关键数据遗漏。此外,专业术语和计量单位的识别,对模型理解能力和知识库构建的精细化程度是考验,影响召回效果。升级时,需确保数据迁移的完整性和模型兼容性,避免因版本差异导致知识库失效或查询性能下降。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 1000 MB | ADC申报资料单个文件(如临床研究报告)常较大,需支持大文件上传。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 复杂PDF或扫描件解析耗时较长,预留充足时间防止超时中断。 |
分段长度 | 800–1200 字符 | 兼顾语义完整性和检索效率,避免过度碎片化或信息过载。 |
相似度阈值 | 0.78 | ADC数据专业性强,提高阈值可减少不相关内容召回,提升精准度。 |
召回条数 | 前 5 条 | 优先关注最相关的少数结果,减少工程师筛选工作量。 |
maxContext | 8192 | 确保大段临床数据或CMC描述能被完整纳入上下文,提升理解。 |
容易做错的三处
- 升级后知识库查询结果不准确,原因在于新版本模型对某些专业术语的嵌入方式发生变化,导致向量匹配偏差。
- 上传大型PDF文件时长时间无响应或报错
HTTP 504 Gateway Timeout,原因常是文件解析器处理时间超出默认网关超时限制。 - 部署后,部分临床试验报告中的表格数据未能正确提取,表现为字段为空或数据错位,原因在于文件解析器对复杂表格结构的处理能力不足。
怎么确认配好了
- 上传多个典型的ADC申报文档(如药代动力学报告、临床试验方案),检查文件解析进度和知识库构建状态,确认无报错且用时在合理范围。
- 针对知识库中的关键数据点(如某个药物的
Cmax值、特定不良事件发生率),进行多次提问,比对回答与原文信息是否一致,确认召回准确性。 - 模拟工程师日常查询场景,输入包含专业术语和缩写的问题,观察返回的召回结果和引用原文,验证
相似度阈值和召回条数是否能有效定位到所需信息。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。