这个品类的数据长什么样
CAR-T 细胞治疗的制度与 SOP 数据主要来源于药监部门发布的法规文件、医院内部制定的操作规范、以及药企提供的药品说明书和临床试验方案。这些数据通常以 PDF 文档、Word 文档、以及少量结构化表格的形式存在。更新频率方面,国家层面的法规文件通常是季度或半年更新,医院内部 SOP 则可能根据临床实践和监管要求进行月度或季度修订,而药品说明书则随批次或版本迭代更新。文档结构上,法规文件常包含章节、条款、附件等层级,SOP 则通常有目的、范围、职责、流程步骤、注意事项等固定栏目。字段与单位方面,涉及剂量(例如 10^6 cells/kg)、时间(天、小时)、温度(℃)、以及各种生物指标(CD3+ 细胞百分比)等,单位严格且多样。
这些特征在「工作流编排」这一环带来什么约束
CAR-T 细胞治疗制度的数据特征对工作流编排提出了特定要求。法规文件的层级结构意味着知识库需要支持深层语义理解和关联查询,以避免仅匹配关键词而忽略上下文。SOP 的流程性特点要求工作流能够模拟决策树,引导用户逐步获取信息。频繁的更新周期需要工作流具备高效的版本管理和增量更新能力,确保查询结果的准确性。例如,当某项治疗方案的适应症范围发生变化时,工作流需要能够快速识别并更新相关知识片段。此外,涉及精确计量和单位的字段,要求工作流在信息提取和生成回答时,能够严格保持数值和单位的一致性,防止因单位混淆导致的安全风险。复杂的生物指标可能需要工作流集成外部计算或校验模块,以验证数值的合理性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 保障法规条款或 SOP 步骤的语义完整性,避免关键信息被切割。 |
分段重叠长度 | 100–200 字符 | 确保上下文衔接,处理跨段落的指代关系和逻辑依赖。 |
召回条数 | 8–12 条 | 平衡召回精度与计算开销,覆盖制度中可能相关的多个条款或步骤。 |
相似度阈值 | 0.78–0.85 (cosine similarity) | 提高相关性召回,过滤掉低相关度的通用性内容,聚焦制度细节。 |
重排返回条数 | 3–5 条 | 筛选出最核心、最直接相关的制度或 SOP 章节,减少模型处理噪音。 |
LLM_MAX_TOKENS | 4096 tokens 或更高 | 适应法规和 SOP 文档的复杂性和长度,确保能容纳足够的上下文进行推理。 |
容易做错的三处
- 回答中出现过时的法规或 SOP 内容,原因在于知识库同步机制未及时处理源文档的版本更新。
- 工作流在处理剂量或时间单位时出现混淆,例如将
mg/kg误读为g/kg,其原因是文本分段时切断了数值与单位的关联。 - 用户提问关于特定流程步骤时,工作流未能提供完整的操作指引,仅返回了部分信息,这通常是由于工作流的逻辑分支设计未能充分覆盖所有可能的路径或条件判断。
怎么确认配好了
- 选取近期更新的 CAR-T 治疗方案适应症变更文件,测试相关问答,核对回答中是否引用了最新版本的内容。
- 针对涉及药物剂量、给药时间等关键参数的问题,检查回答中数值和单位的准确性,确保与原始 SOP 文档中的
μg/kg或小时等字段严格一致。 - 模拟一个复杂的多步骤操作流程问题,观察工作流是否能按照 SOP 逻辑,逐步引导用户完成查询,并提供完整的操作步骤,例如从细胞收集到回输的整个流程。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。