这个品类的数据长什么样
抗体偶联药物 ADC 的数据来源多样,主要包括公开的临床试验数据库、药物研发文献、专利信息以及药企内部的化合物库数据。这些数据更新频率不一,临床试验数据通常在试验进展或结果发布时更新,而专利和文献数据则随学术发表和审批周期定期增加。ADC药物的文档结构复杂,常包含靶点信息、偶联技术、毒素分子结构、连接子类型、药代动力学(PK)和药效学(PD)数据、临床前与临床试验结果等。字段上,分子式、CAS号、摩尔质量、半衰期等是常见且关键的单位,如 ng/mL(纳克/毫升)用于血药浓度,nM(纳摩尔)用于结合亲和力。
这些特征在「向量模型与索引」这一环带来什么约束
ADC药物的多模态数据特性,如结构式、序列信息与文本描述并存,要求向量模型能有效融合不同类型的信息。高维度的分子结构数据需要专门的编码策略,以捕捉其功能基团和空间构象特征。数据更新的不规则性,特别是临床试验数据的阶段性披露,意味着索引需要支持增量更新和版本管理,以确保信息的时效性。文档中包含的专业术语、缩写以及跨学科概念,如免疫学和有机化学,对向量模型的语义理解能力提出更高要求。此外,药代动力学和药效学数据中的数值型和时间序列信息,需要向量索引能够支持多属性过滤和范围查询,以精确检索特定条件下的药物表现。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 512 字符 | 平衡了语义完整性与向量模型处理效率,避免过长段落稀释关键信息。 |
召回条数 | 前 10 条 | 保证在初次召回时能覆盖到足够多的相关文档片段,为后续重排提供基础。 |
相似度阈值 | 0.75-0.85 | 针对 ADC 领域专业术语多、语义关联性强的特点,确保高相关性结果。 |
重排返回条数 | 前 3 条 | 聚焦于最具相关性的少数高质量结果,减少冗余信息。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对包含复杂分子结构图和大量表格的 PDF 文档解析需求。 |
embeddingModel | text-embedding-ada-002 或本地部署 bge-large-zh | 兼顾语义理解深度与部署灵活性,支持中文专业文献处理。 |
容易做错的三处
- 知识库频繁显示“正在索引”状态,长时间无法完成,导致查询结果不及时。原因可能是
PARSE_FILE_TIMEOUT_SECONDS参数设置过低,对于包含大量图片和复杂表格的 ADC 研发报告无法在规定时间内完成解析。 - 查询特定分子结构或药代动力学数据时,返回结果的相关性不足,甚至出现无关信息。原因在于
相似度阈值设置过低,或者未针对 ADC 领域的专业词汇进行定制化的停用词或同义词配置。 - 调用 embedding 模型时出现
503 Service Unavailable错误,且提示“当前分组 default 下对于模型 text-embedding”,导致向量化失败。原因通常是 One API 路由配置问题,或后端 embedding 服务负载过高、连接超时。
怎么确认配好了
- 上传典型 ADC 研发报告(含结构式、PK/PD曲线),检查知识库是否能顺利完成索引,没有出现超时或解析错误提示。
- 针对 ADC 靶点、偶联方式、毒素类型等核心概念进行查询,通过观察
召回条数和相似度阈值下返回结果的质量和数量来评估。 - 使用包含特定 CAS 号或摩尔质量等精确字段的查询,确认系统能通过多属性过滤或精确匹配,返回包含这些字段的文档片段。
- 检查 One API 或本地 embedding 服务的日志,确保在知识库更新或查询时,embedding 模型调用成功,且响应时间在可接受范围内。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。