这个品类的数据长什么样
实体瘤药物警戒数据主要来源于临床试验报告、真实世界研究(RWE)、上市后不良事件报告(ADR)以及医学文献。数据更新频率高,尤其是上市后ADR数据,可能每日都有新增。文档结构多样,包括结构化的病例报告表(CRF)、半结构化的医学记录、自由文本的医生手写记录和患者自述。关键字段包括药品通用名、商品名、剂量、给药途径、不良事件描述、发生时间、结局、既往病史、合并用药等。不良事件描述常包含医学术语、缩写词、症状体征、诊断结果。剂量单位多样,如毫克(mg)、克(g)、毫升(ml),时间单位包括小时、天、周、月。
这些特征在「向量模型与索引」这一环带来什么约束
实体瘤药物警戒数据的高更新频率要求向量模型支持增量索引和实时更新,以确保召回结果的时效性。文档结构多样性对文本预处理和分段策略提出挑战,自由文本部分需要更精细的文本切分,以捕捉不良事件的完整语境。医学术语和缩写词的普遍存在,要求向量模型具备医学领域知识,提升嵌入质量。剂量与时间单位的多样性,使得单纯基于文本的相似度匹配不足以精确识别相关信息,需要结合命名实体识别(NER)技术,提取并规范化这些关键信息,进而影响向量相似度的计算与排序。这些约束决定了索引构建需兼顾效率与准确性,并对召回结果进行二次排序。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | 临床试验报告和RWE文档可能较大,确保能顺利上传。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理复杂PDF或扫描件的OCR及内容解析需要较长时间。 |
分段长度 | 400–600 字符 | 兼顾不良事件描述的完整性与向量模型处理效率,避免关键信息被截断。 |
重叠长度 | 50 字符 | 确保相邻分段之间有足够的上下文衔接,避免语义断裂。 |
召回条数 | 前 10 条 | 初步召回更多潜在相关分段,提高后续重排的准确率。 |
相似度阈值 | 0.75–0.85 | 平衡召回率与准确率,避免召回过多不相关或遗漏关键不良事件信息。 |
容易做错的三处
- 知识库索引长时间处于构建中状态:通常原因在于
PARSE_FILE_TIMEOUT_SECONDS配置过低,未能处理完大型或复杂的PDF文件。 - 嵌入模型报错 503 或无可用渠道:这通常意味着
ONEAPI_URL或CHAT_API_KEY配置有误,导致 FastGPT 无法连接到指定的嵌入服务。 - 搜索结果中不良事件描述不完整或上下文缺失:这可能与
分段长度设置过短有关,导致一个完整的不良事件信息被分割到多个段落。
怎么确认配好了
- 上传并索引一份包含多种不良事件描述的典型临床报告,检查索引状态是否成功。
- 针对报告中的具体不良事件,通过知识库搜索功能,验证召回结果是否包含完整的描述和相关上下文。
- 调整
相似度阈值,观察召回条数和相关性变化,直至在测试集上达到满意的平衡点。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。