这个品类的数据长什么样
血液肿瘤领域的制度与SOP文档,其数据来源主要包括国家药监局(NMPA)发布的法规、行业协会发布的诊疗指南、医院内部制定的管理规定及临床路径。这些文档的更新频率相对较高,尤其是新药上市、治疗方案迭代或法规调整时,可能每季度甚至每月都会有局部更新。文档结构通常包含标准化的章节标题,如“适用范围”、“术语定义”、“职责分工”、“操作流程”、“风险控制”和“附件”。字段方面,常见有药品名称、剂量、给药途径、疗程、不良反应、检测指标、随访周期等,同时会涉及国际疾病分类(ICD)编码、药品通用名(INN)以及各类生物标志物缩写。单位则严格遵循国际单位制(SI),如 mg/kg、IU/mL、% 等。
这些特征在「工具调用与插件」这一环带来什么约束
血液肿瘤制度文档的高更新频率,要求工具调用与插件具备灵活的数据源同步机制,以确保检索结果的时效性。文档中包含大量专业术语、缩写和编码,这使得在构建查询时,需要考虑同义词扩展和编码映射,避免因术语不匹配导致召回失败。此外,规范化的文档结构为结构化信息提取提供了便利,但也要求插件能够识别并解析特定章节内容,实现精准定位。例如,当用户询问某个药品的“给药途径”时,工具需要能够从“操作流程”或“药品说明书”章节中提取该字段。单位的严格性则要求在数值比较和计算类工具中,必须进行单位转换或校验,避免因单位不一致导致结果错误,例如 mg 与 g 之间的转换。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunkOverlapRatio | 0.15 | 保证上下文连续性,应对制度文档中跨段落的逻辑关联。 |
top_k | 8 | 平衡召回范围与相关性,适用于血液肿瘤制度文档中可能分散的关键信息。 |
maxContext | 3000 Tokens | 适应制度文档篇幅较长、信息密度大的特点,确保模型能接收足够上下文。 |
similarity_threshold | 0.78 | 确保召回内容的精准度,过滤掉与专业术语不相关的结果。 |
query_expansion_factor | 3 | 应对文档中专业术语和缩写的多样性,提升召回覆盖率。 |
http_timeout_seconds | 60 秒 | 考虑到外部工具(如药品数据库API)可能存在的网络延迟,留出足够响应时间。 |
容易做错的三处
- 调用外部药品数据库API时,返回
HTTP 400 Bad Request错误,常见原因是请求参数中药品名称未进行URI编码。 - 在工作流中串联RAG知识库和外部工具时,RAG阶段召回的文档片段未能正确映射到工具所需的输入字段,导致工具调用失败或返回空结果。
- 用户提问中包含的疾病名称或药品缩写,模型未能在调用工具前进行标准化或扩展,导致工具无法识别。
怎么确认配好了
- 通过模拟典型用户问题,检查工作流中RAG知识库的召回内容,确保关键信息(如药品名称、剂量)能被准确抽取。
- 针对涉及外部工具调用的场景,查看工具日志,确认请求参数与返回结果的格式和内容符合预期。
- 设计包含多种专业术语和缩写的测试用例,验证工具调用前是否进行了有效的查询扩展或术语标准化。
- 测试包含数值计算或单位转换的场景,确保工具输出的数值结果在单位上保持一致性和准确性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。