这个品类的数据长什么样
单克隆抗体注册申报资料通常来源于药企内部研发文档、临床试验报告、生产工艺记录以及法规指南。这些数据更新频率相对较低,主要集中在新药研发阶段和上市后变更申报时。文档结构复杂,包含大量非结构化文本、图表、结构式图片和表格数据。字段与单位具有高度专业性,例如“抗体浓度”常以 mg/mL 表示,“纯度”以百分比表示,而“效价”则可能涉及复杂的生物学单位如 IU/mg 或相对效价。文档中还常包含特定术语,如 CDR (互补决定区) 或 Fc 段修饰。
这些特征在「知识库检索与召回」这一环带来什么约束
单克隆抗体资料的复杂文档结构和专业术语,要求知识库在切分时能识别并保留关键信息的完整性。例如,涉及抗体结构域的描述,不应被随意截断。低更新频率使得初期构建知识库需要投入大量精力进行数据清洗和标注,但后续维护成本相对较低。大量非结构化文本和图表的存在,对文本嵌入模型和多模态检索能力提出要求,纯文本检索可能无法有效召回包含关键图表信息的段落。专业字段和单位的准确识别,避免因单位转换或误解导致检索结果偏差。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾单克隆抗体资料的段落完整性和嵌入模型的处理能力,避免关键信息被截断。 |
召回条数 | 8–12 条 | 考虑到单克隆抗体申报资料的复杂性,需要更多上下文来确保全面理解,同时控制检索负载。 |
相似度阈值 | 0.78–0.85 | 针对专业术语和概念,设置较高阈值以提高检索精度,减少不相关信息的干扰。 |
重排返回条数 | 5 条 | 对初召结果进行精细化排序,优先展示与查询意图最相关的核心段落。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 单克隆抗体申报资料中大型 PDF 文件较多,预留充足时间完成文件解析。 |
UPLOAD_FILE_MAX_SIZE | 500 MB | 允许上传包含大量图表和数据的超大 PDF 文件,满足实际需求。 |
容易做错的三处
- 现象:AI 回复“没有找到答案”,但知识库中明明存在相关信息。 原因:知识库中关键信息以图片形式存在,纯文本检索未能有效识别和召回图片内容。
- 现象:API 调用时提示知识库 ID 错误或无法获取知识库内容。 原因:API 调用工作流中知识库 ID 未正确传入,或者传入的
knowledgeBaseId并非系统实际使用的 ID。 - 现象:上传大型 PDF 文件时,经常出现“偏移量超出范围”的错误。 原因:后端文件处理服务对大文件分片或流式处理存在缺陷,或者网络传输不稳定导致数据损坏。
怎么确认配好了
- 上传包含关键图表和文本的单克隆抗体申报资料,验证知识库是否能正确解析并创建嵌入。
- 针对特定抗体浓度、纯度等专业字段进行查询,检查召回结果是否包含准确的数值和单位。
- 使用与申报资料中复杂概念相关的长尾问题进行检索,评估召回段落的完整性和相关性。
- 模拟 API 调用,传入
knowledgeBaseId参数,确认能够成功检索并返回预期结果。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。