这个品类的数据长什么样
抗体偶联药物(ADC)的注册申报资料涉及多源异构数据,包括非临床研究报告(药理毒理、药代动力学)、临床试验数据(I/II/III期报告、病例报告表)、生产工艺与质量控制文件(CMC,如抗体生产、连接子偶联、毒素制备、成品分析)、以及药学研究数据。数据来源多样,涵盖内部研发文档、CRO报告、监管机构指导原则和已上市药物公开信息。更新频率在研发的不同阶段差异显著,早期研发阶段更新频繁,临床阶段则随试验进展周期性更新。文档多为 PDF 格式,包含大量表格、图表和结构化文本。字段与单位具有高度专业性,例如药代动力学参数(Cmax、AUC、`t1/2,单位 ng/mL、µg·h/mL、h)、毒性指标(LD50,单位 mg/kg)、质量属性(Purity,单位 %)。
这些特征在「模型接入与配置」这一环带来什么约束
ADC 申报资料的多源异构性要求模型接入支持多种文件格式的解析,特别是对复杂 PDF 中表格和图表的结构化提取能力。数据更新频率的差异,特别是临床试验数据的持续迭代,意味着知识库需要支持增量更新和版本管理,以确保模型始终基于最新资料进行回答。文档的高度专业性和复杂结构,如 CMC 部分的详细工艺流程和质量控制参数,对文本分段和嵌入模型选择提出更高要求,需要能有效识别和保留专业术语间的关联性。字段与单位的精确性,例如剂量、浓度和时间参数,决定了模型在提取和生成答案时必须准确无误,避免因单位混淆导致的关键信息错误。因此,在配置时需特别关注文本处理的精细度、知识库更新策略以及模型对专业知识的理解深度。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | ADC 资料中存在较长的实验方法描述和结果讨论,较长的分段有助于保持上下文完整性。 |
分段重叠长度 | 100–150 字符 | 确保相邻段落间的语义连续性,尤其在跨段落的专业术语或数据引用时。 |
解析模式 | 高级模式 | 应对复杂 PDF 中包含的表格、图表及多栏布局,提高结构化信息提取准确率。 |
召回条数 | 8–12 条 | ADC 申报资料查询通常需要综合多个维度的信息,适当增加召回条数可提高全面性。 |
相似度阈值 | 0.75–0.85 | 确保召回内容的专业相关性,过滤掉干扰信息,特别是针对细微的药学差异。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | ADC 资料文件通常较大且复杂,解析耗时较长,需要更长的超时时间。 |
容易做错的三处
- 调用外部大模型时,若模型接口仅支持
stream模式,FastGPT 配置中未勾选或未正确处理stream响应,会导致模型调用失败或响应不完整。 - 在内网环境中部署 FastGPT 并尝试连接内部 DeepSeek API 时,如果
模型渠道配置的API 地址未使用服务器可访问的内网 IP 或域名,会导致error状态码和获取数据异常。 - 知识库文档上传后,未能正确提取关键数据字段(如
Cmax、AUC值),通常是由于解析模式选择不当或 PDF 文档结构过于复杂,导致Embedding质量下降。
怎么确认配好了
- 上传一份包含复杂表格和图表的 ADC 非临床研究报告 PDF,检查知识库中分段内容是否完整且结构化信息(如表格数据)被正确提取。
- 使用包含 ADC 特定术语和参数(如“抗体药物偶联物 XXX 的
PK/PD特征”)的查询语句,验证模型召回结果的相关性和准确性,并检查召回条数是否符合预期。 - 通过 FastGPT 的
模型渠道测试功能,对配置好的内部 DeepSeek 或其他大模型进行连接测试,确认HTTP 状态码为200或204,且能接收到响应。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。