这个品类的数据长什么样
合理用药制度的数据主要来源于国家卫生健康委员会、国家药品监督管理局发布的各类政策法规、技术指南、专家共识,以及各医疗机构内部制定的规章制度、操作规范(SOP)。这些数据更新频率相对稳定,政策法规类通常按年或根据重大事件发布,指南和共识则可能在数月至一年内更新。文档形式多样,包括 PDF 格式的正式文件、Word 文档、HTML 页面,以及部分以图片或表格形式呈现的药品目录、禁忌列表。文档结构通常包含章节、小节、条款,并可能附带图表、附录。字段与单位方面,涉及药品名称、通用名、剂型、剂量、给药途径、适应症、禁忌症、不良反应、相互作用,以及各类临床指标的正常范围和异常阈值,例如 mg/kg、IU、mol/L 等。
这些特征在「向量模型与索引」这一环带来什么约束
合理用药制度的政策法规和指南类文档,其文本内容通常篇幅较长、结构复杂,包含大量专业术语和逻辑关联,要求向量模型能够捕捉长距离依赖关系和概念间的语义联系。更新频率适中意味着索引策略需兼顾初期构建效率和后续增量更新的便捷性。文档中包含的图片、表格等非结构化信息,需要额外的处理流程将其内容转化为可向量化的文本描述,例如通过 OCR 或表格解析技术。多样化的字段与单位,特别是数值型临床指标,在检索时可能需要支持范围查询或单位转换,这要求向量索引具备一定的结构化信息处理能力,或在预处理阶段进行标准化。此外,制度条款间的引用和交叉关联,增加了对检索结果上下文完整性的要求。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 确保单个分段包含足够的上下文信息,同时避免过长导致语义漂移。 |
分段重叠 | 100 字符 | 衔接相邻分段,提高检索召回率,减少上下文断裂。 |
embedding_model | text-embedding-ada-002 或 bge-large-zh | 兼顾语义理解能力和中文处理效果,适应专业术语。 |
召回条数 | 前 5–8 条 | 覆盖相关性较高的原始文档片段,为后续重排提供足够候选。 |
相似度阈值 | 按实测标定 | 依据具体数据集和模型表现,平衡查准率与查全率。 |
重排返回条数 | 前 3 条 | 精选最相关的少数片段,提升最终答案的精准度和简洁性。 |
容易做错的三处
- 现象:检索结果中出现大量无关或低相关度的文档片段,无法有效回答关于药品剂量、禁忌等具体问题。原因:
分段长度设置过长,导致单个分段内信息过于分散,向量表征不够聚焦;或相似度阈值设置过低,召回了大量弱相关结果。 - 现象:部分文档中的图片内容,如药品说明书的图示或表格,无法被检索到。原因:在文件上传和处理阶段,未对图片内容进行有效的 OCR 识别或表格结构化提取,导致其信息未能转化为文本并进行向量化。
- 现象:FastGPT 本地部署后,模型或向量服务连接失败,报错
Connection refused或Timeout。原因:oneapi配置中的模型地址或 API 密钥不正确,或者防火墙阻断了 FastGPT 容器与模型服务之间的网络通信。
怎么确认配好了
- 上传典型合理用药制度文档,检查知识库中每个分段的内容是否完整、语义连贯,不出现重要信息截断。
- 针对不同粒度的问题(如“某药品的适应症”、“某疾病的用药指南”),进行多轮测试,对比检索结果的
相似度分数,并人工判断召回片段与问题的相关性。 - 使用包含图片和表格的文档进行测试,验证其内容是否能被正确解析、向量化,并在检索时能否被有效召回。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。