这个品类的数据长什么样
抗体偶联药物(ADC)药物警戒数据主要来源于临床试验报告、真实世界研究、上市后不良事件报告(如 CIOMS I 表、MedWatch 表格)、学术期刊文献及药品说明书。数据的更新频率在临床试验阶段较高,报告周期可能为数周或数月;上市后则为持续性、不定期的报告。文档结构通常包含非结构化的自由文本描述(如不良事件详情、患者病史)、半结构化的表格数据(如药物剂量、给药途径、不良事件编码如 MedDRA 术语)以及结构化的患者基本信息。关键字段包括药品通用名、批次号、不良反应描述、发生时间、严重程度、结局、相关实验室指标(如肝肾功能、血常规)、伴随用药及既往病史。单位涉及剂量(mg/kg)、时间(天、小时)、实验室结果(U/L、g/L、mmol/L)等。
这些特征在「向量模型与索引」这一环带来什么约束
ADC 药物警戒数据中的非结构化自由文本描述,对向量模型准确捕捉不良事件的细微语义构成挑战。MedDRA 术语等半结构化编码的存在,要求向量模型既能理解自然语言,也能识别并利用标准化医学术语的上下文信息。数据更新的持续性与不定期性,意味着索引需要支持增量更新,避免频繁全量重建,以保持时效性。多源异构数据导致文档长度不一,从简短的报告到详细的临床记录,对分段策略提出要求,需确保关键信息不被截断或稀释。不良事件的严重程度、结局等结构化信息,需要向量模型在生成向量时能够体现其重要性,以便在检索时优先召回高价值信息。特定实验室指标的数值和单位,要求向量化过程能够区分数值大小和单位差异,避免混淆。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 平衡上下文完整性与向量化效率,适应 ADC 报告中描述性文本的长度。 |
分段重叠长度 | 100–200 字符 | 确保跨段语义连续性,避免关键信息被分段边界割裂。 |
embedding_model | text-embedding-3-large | 提供更高的语义理解能力和维度,提升对医学术语和复杂描述的区分度。 |
召回条数 | 8–15 条 | 考虑到 ADC 不良事件的复杂性和多样性,增加召回量以提高覆盖率。 |
相似度阈值 | 0.75–0.85 | 兼顾精确召回和适当泛化,避免漏报或过度召回不相关信息。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 适应大型临床试验报告或详细不良事件描述文件解析可能需要的较长时间。 |
容易做错的三处
- 知识库查询结果中出现大量不相关条目,原因在于
相似度阈值设置过低,导致召回范围过广,未能有效过滤噪声。 - 上传大型 PDF 格式的临床试验报告时,系统提示
文件解析超时,原因为PARSE_FILE_TIMEOUT_SECONDS值不足以处理文件复杂性和大小。 - 更新部分不良事件报告后,检索结果未体现最新信息,原因在于知识库未进行增量索引或索引重建,导致向量库与原始数据不同步。
怎么确认配好了
- 选取包含典型 ADC 不良反应描述的测试数据,进行查询,核对召回结果是否包含所有相关关键信息。
- 上传一份包含 MedDRA 术语和自由文本描述的混合文档,观察其能否被正确分段,并查看各段落的向量表示是否能区分出医学术语的语义。
- 监测
embedding_model更换后,索引重建任务的完成状态,确保所有知识库都已更新至新模型。 - 模拟高并发查询场景,检查系统响应时间,并与基线性能进行比较,确保
召回条数和相似度阈值的设置不会导致性能瓶颈。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。