这个品类的数据长什么样
CAR-T 细胞治疗领域的制度与标准操作程序(SOP)文档通常以 PDF、Word 或内部知识管理系统的形式存在。这些文档内容复杂,涵盖从患者筛选、细胞采集、制备、质控到输注、随访及不良事件管理的整个流程。文档结构严谨,包含大量医学术语、操作步骤、图表以及交叉引用的内部或外部法规文件。更新频率相对较低,通常随监管政策变化或临床实践改进而进行修订,大约每季度或半年一次。字段方面,涉及批次号、患者 ID、细胞类型、剂量、质控指标(如细胞活力、纯度)、不良反应分级等,单位精确到微升、毫升、百分比、国际单位等,对准确性要求极高。
这些特征在「工具调用与插件」这一环带来什么约束
CAR-T 细胞治疗制度文档的复杂性和严谨性,对工具调用与插件提出了高要求。文档中的交叉引用和特定术语,使得简单的关键词匹配难以准确召回所需信息,需要具备理解上下文和语义关联的能力。较低的更新频率意味着模型不需要频繁地重新训练或索引,但每次更新都需要确保增量索引的准确性。大量精确的数值和单位,要求工具在提取和判断时能区分数值的含义,例如区分“细胞计数”与“输注剂量”。当AI平台在回答中引用制度条文时,必须能够精准定位到原文的出处,包括页码或章节,以满足合规性要求。因此,工具调用需要能处理复杂文档结构,并支持高精度的事实抽取与校验。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | CAR-T 制度文档段落较长且逻辑连贯,过短分段会丢失上下文,过长则可能引入不相关信息。 |
召回条数 | 前 5 条 | 确保覆盖多个可能相关的制度章节,CAR-T 制度的问答往往需要综合多条信息。 |
相似度阈值 | 0.78–0.85 | 确保召回内容的精准性,避免引入医学专业领域不相关的模糊匹配,同时留有一定容错空间。 |
重排返回条数 | 前 3 条 | 经过重排后,最相关的三条通常足以支撑大部分制度问答,避免冗余。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | CAR-T 制度文件通常较大且包含图表,解析耗时较长,需要更长的超时时间来完成处理。 |
MAX_TOOL_CALLS | 3 | 限制单次查询的工具调用次数,平衡响应速度与信息全面性,避免不必要的复杂调用链,制度查询通常在少数工具调用内解决。 |
容易做错的三处
- 现象:AI 回答中引用的制度条文与实际文档内容不符,或者引用了不相关的章节。原因:
相似度阈值设置过低或分段策略不合理,导致召回了语义上不够精确的文档片段。 - 现象:工作流中工具调用模块未能触发,AI 直接给出通用性回答。原因:用户提问未包含足够触发工具的关键词或意图,或者工具的
描述或输入参数定义不够清晰,未能与用户意图匹配。 - 现象:解析制度文档时出现超时错误,部分文档内容未被索引。原因:
PARSE_FILE_TIMEOUT_SECONDS设置过短,大型 PDF 或 Word 文件在复杂解析过程中未能及时完成。
怎么确认配好了
- 针对核心制度条款,通过模拟提问观察 AI 回答是否能准确引用原文链接和具体内容,并检查引用的准确性。
- 使用不同类型的查询(如操作步骤、定义、异常处理)测试工具调用是否能被正确触发,并检查输出结果的格式和完整性。
- 在文档更新后,执行增量索引并进行抽样查询,确认新内容能够被准确召回,并核对关键数值和单位的识别情况。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。