这个品类的数据长什么样
药物经济学研究的数据主要来源于临床试验报告、真实世界研究数据、卫生技术评估(HTA)报告、成本效益分析模型、药企内部市场准入文档以及政府医保政策文件。这些文档更新频率相对较低,通常随新药上市、适应症扩展或医保目录调整而更新。文档结构以结构化或半结构化文本为主,包含大量图表、表格与专业术语。字段涉及药品名称、适应症、治疗方案、疗效指标(如 QALY、LYG)、成本构成(直接成本、间接成本)、效应值、增量成本效益比(ICER)等。单位则涵盖货币单位(美元、欧元、人民币)、时间单位(年、月)、生命质量单位(QALY)以及各种统计学指标。
这些特征在「向量模型与索引」这一环带来什么约束
药物经济学文档的低更新频率意味着知识库的重建或增量更新操作不必过于频繁。文档中包含的专业术语、缩写以及跨语言(如英文原文与中文翻译)的并存,要求向量模型具备高语义理解能力,能够捕捉词汇之间的深层关联。大量的数值数据、表格和图表内容,对索引的分段策略提出挑战,需要确保数值上下文的完整性。例如,一个 ICER 值必须与其对应的成本、效应以及比较方案一同被索引,才能在召回时提供有意义的答案。此外,多维度的字段信息,如不同国家或地区背景下的药物经济学数据,要求索引能够支持更精细的元数据过滤,以避免不相关的召回。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 平衡上下文完整性与召回精度,兼顾专业术语的长短 |
分段重叠长度 | 100–150 字符 | 确保段落间语义连续性,避免关键信息被切割 |
向量模型 | Doubao-embedding 或 text-embedding-ada-002 | 针对专业领域文本,选择语义理解能力强的模型 |
召回条数 | 8–12 条 | 增加召回相关信息的概率,覆盖不同侧面信息 |
相似度阈值 | 0.75–0.85 | 过滤不相关段落,确保召回结果的精确性 |
重排返回条数 | 3–5 条 | 优化最终呈现结果,聚焦最核心的相关内容 |
容易做错的三处
- 知识库切换向量模型后进度停滞,且无法强制切换。原因在于模型切换操作可能需要清空并重建所有向量索引,若数据量大或资源不足,此过程耗时较长,前端未及时响应或后端任务阻塞。
- 配置 Doubao-embedding 等本地或私有化部署的 embedding 模型时,测试报告
404 page not found错误。原因通常是 API 地址配置有误,或者 FastGPT 部署环境无法访问到该 embedding 服务的端口。 - 索引图片或表格内容时,召回结果缺乏关键数值信息,如 ICER 值或成本数据。原因在于默认文本分段策略未能有效处理非文本内容,导致数值与上下文脱离,或图片内容未被正确 OCR 并转化为可索引文本。
怎么确认配好了
- 上传典型药物经济学文档(如一份 HTA 报告),检查知识库索引状态,确保所有文件均已完成索引。
- 使用文档中的专业术语、特定成本效益比值进行问答测试,验证召回结果是否包含相关段落和数值。
- 尝试查询不同国家或地区的药物经济学数据,观察是否能通过元数据过滤功能有效筛选出对应信息。
- 定期检查日志,确保向量模型调用无异常报错,且索引任务均能正常完成。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。