这个品类的数据长什么样
抗体偶联药物(ADC)的注册申报资料涉及多方面数据。核心数据源包括临床试验报告(ICH E3格式)、非临床研究报告(GLP/GCP标准)、CMC(化学制造与控制)文档以及药学研究数据。这些资料通常以PDF、Word或XML等格式存在,其中包含大量的结构化和非结构化文本。例如,临床试验报告会详细记录患者入组、用药方案、不良事件和疗效数据,涉及剂量单位(mg/kg)、时间单位(周、月)等。CMC部分则涵盖抗体生产工艺、偶联反应、纯化步骤、质量控制指标(如纯度、聚集体含量、药物抗体比 DAR 值),以及稳定性数据。数据更新频率在研发阶段较高,申报阶段则主要围绕补正资料进行。
这些特征在「工具调用与插件」这一环带来什么约束
ADC注册申报资料的复杂性与多样性对工具调用与插件提出了特定要求。首先,资料中大量专业术语和缩写,要求插件具备高精度的文本识别和语义理解能力,尤其是在非结构化文本中提取关键信息时,例如从不良事件描述中识别特定毒性类型。其次,CMC数据涉及大量图表和结构化数据,需要工具能够解析表格数据,并进行单位转换或一致性校验,例如检查不同批次DAR值的波动范围。再次,由于资料更新和补正的常态化,插件需要支持版本管理和增量更新,确保知识库内容的实时性和准确性。最后,多模态数据(如部分非临床研究中的图片)处理能力,虽然不是注册申报的主流,但在某些特定情况下也会对信息提取构成挑战。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 8000 tokens | ADC资料上下文关联性强,保持足够长的上下文窗口有助于理解药物的整体安全性和有效性。 |
分段长度 | 500–800 字符 | 兼顾语义完整性和召回效率,避免长段落稀释关键信息,同时避免过短导致上下文丢失。 |
召回条数 | 前 10–15 条 | 注册申报资料往往需要多角度信息交叉验证,增加召回条数可提高相关性覆盖率。 |
相似度阈值 | 0.75–0.85 | 确保召回内容的精确性,避免无关或低相关性文本干扰对ADC特定问题的判断。 |
重排返回条数 | 前 5 条 | 在高召回量基础上,通过重排聚焦最核心的几条信息,提高最终答案质量。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | ADC资料中存在大量大型PDF文件,延长解析超时时间可确保文件完整处理。 |
容易做错的三处
- 插件调用后返回结果为空,或仅包含部分信息。原因在于文档解析时未充分提取表格数据或嵌入的图片说明文本。
- 在处理临床研究报告时,不良事件类型识别错误或剂量单位混淆。原因在于底层模型对特定生物医药术语和计量单位的识别能力不足,或未进行充分的领域知识微调。
- 连续提问时,模型对ADC历史上下文的遗忘导致回答不连贯。原因在于会话管理机制未有效保留或传递完整的历史对话信息。
怎么确认配好了
- 选择一份包含复杂表格和专业术语的ADC临床报告,上传并使用插件提取关键数据,核对提取结果的完整性和准确性。
- 针对ADC的CMC部分,测试插件能否正确识别并提取药物抗体比(DAR)值、纯度百分比等关键质量属性,并验证数值范围的合理性。
- 模拟多轮问答场景,围绕ADC的安全性、有效性以及生产工艺等主题进行提问,观察模型在不同轮次间对上下文的保持能力,并评估回答的逻辑一致性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。