这个品类的数据长什么样
血液肿瘤产品的数据来源多样,主要包括临床试验报告、药品说明书、医学指南、专利文献以及学术论文。这些数据更新频率较高,特别是临床试验进展和新药上市信息,通常以月度或季度为周期进行更新。文档结构上,药品说明书和临床试验报告往往采用结构化数据与非结构化文本混合的形式,包含剂量、适应症、不良反应、作用机制、药代动力学等关键信息。专利文献则侧重于化合物结构、制备方法和适应症范围。字段方面,特异性强,如 ICD-O-3 编码、疾病分期、靶点基因、突变类型、给药途径、药效学指标(如 CR、PR 率)等。单位则严格遵循医学规范,如 mg/kg、μg/mL、mmol/L。
这些特征在「工作流编排」这一环带来什么约束
血液肿瘤数据的多源性与高更新频率要求工作流具备灵活的数据摄取与整合能力,需要支持多种文件格式的解析和定期数据同步。结构化与非结构化混合的文档结构,使得工作流在信息提取时,既要能准确识别关键实体,又要能理解上下文语义,对 RAG 检索增强生成的效果提出更高要求。特异性强的字段与专业单位,要求工作流在实体识别和知识图谱构建阶段进行精确配置,避免因语义歧义导致的信息错误。例如,CR 在不同语境下可能代表完全缓解或某种细胞类型,工作流需通过上下文或预设规则进行区分。此外,对历史数据的追溯能力也至关重要,因为血液肿瘤产品的审批和使用会参考大量既往研究,工作流需支持版本管理和历史快照,确保溯源性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 6000 token | 确保能容纳临床试验报告和药品说明书中的主要信息,避免关键上下文截断。 |
召回条数 | 前 8 条 | 考虑到血液肿瘤知识的复杂性和关联性,适当增加召回条数以覆盖更多潜在相关文档。 |
相似度阈值 | 0.78 | 提高阈值以过滤掉与血液肿瘤产品咨询相关性较低的文档,确保召回的精确性。 |
重排返回条数 | 前 3 条 | 聚焦于最相关的核心信息,减少用户处理不必要信息的负担。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型临床试验报告或多份专利文档时,提供充足的文件解析时间。 |
分段长度 | 800 字符 | 兼顾语义完整性和检索效率,确保每个分段包含足够的信息用于上下文理解。 |
容易做错的三处
- 工作流中的“代码运行”节点在处理包含“历史记录”的输入时校验失败,这通常是由于历史记录的数据结构与代码预期不符,或者变量作用域配置不当,导致无法正确访问或解析历史变量。
- 问题分类节点未能准确识别用户对具体靶向药物的咨询意图,表现为将关于
伊马替尼的问题错误分类为通用癌症治疗,原因在于分类模型的训练数据不足以覆盖血液肿瘤领域的细致产品名和作用机制。 - 在循环体内部无法访问循环体外部已定义的变量,导致数据处理中断或结果不一致,这通常是由于工作流编排时未将外部变量正确传递给循环体作用域,或变量生命周期管理不当。
怎么确认配好了
- 选取多个具有代表性的血液肿瘤产品咨询案例,手动执行工作流,验证
RAG召回的文档是否准确且全面,并评估其与用户问题的相关性。 - 针对不同类型的血液肿瘤产品(如靶向药、免疫疗法、化疗药),模拟用户咨询,检查问题分类节点能否将其正确归类,并观察后续信息提取的准确性。
- 跟踪工作流执行日志,检查是否存在
PARSE_FILE_TIMEOUT_SECONDS超时错误或maxContext截断警告,确保文件解析和上下文处理能力符合预期。 - 使用包含特定疾病分期、基因突变和药效学指标的复杂查询,验证工作流能否精确识别并提取这些特异性字段,并在最终回答中体现其专业性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。