这个品类的数据长什么样
CAR-T 细胞治疗的临床试验数据主要来源于全球各临床试验注册库(如 ClinicalTrials.gov、欧洲临床试验注册库)以及相关学术期刊、会议报告。这些数据更新频率较高,通常随试验进展或结果发布而季度或半年度更新。文档结构以结构化表格与非结构化文本混合为主,结构化部分包含试验编号、研究阶段、疾病类型、药物名称、剂量、患者入排标准、主要终点与次要终点等。非结构化部分则涵盖详细的试验方案描述、患者招募信息、不良事件报告、以及研究者对结果的解读。字段包括基因编辑位点、细胞扩增倍数、输注剂量(例如 1x10^6 CAR-T 细胞/kg)、随访时间(如 6 个月、12 个月),单位需严格区分细胞数、剂量、时间和百分比。
这些特征在「引用来源与溯源」这一环带来什么约束
CAR-T 临床试验数据的高更新频率要求知识库能快速同步最新进展,避免引用过期信息。结构化与非结构化混合的文档特性,使得在预筛过程中需要同时从结构化字段中提取精确数值,并从非结构化文本中理解复杂的入排标准描述。例如,患者的基因型、既往治疗史、特定生物标志物表达水平等关键信息,可能散布在多段描述性文字中。引用来源需精准定位到这些具体段落或表格行,以支持对患者是否符合入排标准的判断。同时,由于CAR-T治疗的高度专业性,引用来源的权威性至关重要,系统必须能够溯源到原始发布机构或研究团队,确保信息的可靠性,并识别潜在的试验设计差异或报告偏差。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 适应 CAR-T 临床试验方案中详细的入排标准和不良事件描述,确保上下文完整性。 |
召回条数 | 前 8 条 | 考虑到 CAR-T 试验的高度复杂性,需要更多相关段落进行综合判断。 |
相似度阈值 | 0.75 | 提高匹配精度,避免将不同靶点或不同治疗阶段的试验混淆。 |
重排返回条数 | 3 条 | 在召回基础上进一步精炼,聚焦最相关的三条引用,减少冗余信息。 |
引文变量格式 | [标题](URL) | 直接提供原始文档链接,便于工程师快速跳转查阅完整试验报告。 |
引用来源显示 | 显示 | 关键信息需要明确来源,以支持临床判断的严谨性。 |
容易做错的三处
- 模型回复中引用来源缺失,原因可能是知识库分段策略不当,导致关键信息被截断,无法形成有效引用。
- 系统提示
quote type error,通常是由于传入的变量类型与预期不符,例如期望数值却传入了文本描述。 - 回复中引用的试验版本与最新进展不符,原因在于知识库同步机制未及时更新,引用了过期的临床试验数据。
怎么确认配好了
- 输入多个典型患者案例,检查回复中引用的试验编号、疾病类型、入排标准是否准确对应。
- 核对引用来源的 URL 是否可访问,并指向原始的临床试验注册页面或学术文献。
- 对比模型回复中提取的关键数值(如
CD19阳性率、剂量范围)与引用原文,确认一致性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。