这个品类的数据长什么样
CAR-T 细胞治疗相关的临床试验数据主要来源于国家药品监督管理局药品审评中心(CDE)的临床试验登记与信息公示平台、美国国立卫生研究院(NIH)的 ClinicalTrials.gov 等官方数据库,以及各类医学期刊、会议论文、药企公开报告等。数据更新频率不一,官方平台通常按季度或月度更新,而学术论文则持续发布。文档结构以结构化表格数据为主,包含患者入组标准、排除标准、治疗方案、剂量、疗效指标(如完全缓解率 CR、部分缓解率 PR)、不良事件 AE 等。非结构化文本如研究方案、知情同意书、病例报告表 CRF 也大量存在,字段与单位严格遵循医学规范,例如年龄以“岁”计,剂量以“10^6 cells/kg”或“mg/kg”表示,不良事件分级采用 CTCAE 标准。
这些特征在「多轮对话与提示词」这一环带来什么约束
CAR-T 临床试验数据的专业性与多模态性,对多轮对话与提示词设计带来显著约束。结构化数据的精确查询要求提示词能准确映射到数据库字段,例如查询“CD19 阳性 B 急性淋巴细胞白血病”患者的“完全缓解率”。非结构化文本则需要提示词具备更强的语义理解能力,从冗长的研究方案中抽取出关键的入排标准。数据更新频率决定了知识库的维护周期,确保对话基于最新信息。此外,医学术语的严格性要求提示词避免歧义,例如“缓解”可能指完全缓解、部分缓解或疾病稳定,需要在对话中明确。多轮对话需要追踪上下文中的患者特征与治疗意图,逐步筛选出符合条件的临床试验,例如第一轮确定疾病类型,第二轮细化到特定基因突变或既往治疗史。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 8000 tokens | 适应医学文本的长度,确保上下文完整,避免关键信息丢失。 |
分段长度 | 500 字符 | 平衡分段粒度与语义完整性,便于模型理解和检索。 |
召回条数 | 前 8 条 | 提高相关信息的覆盖率,应对医学查询的复杂性。 |
相似度阈值 | 0.78 | 确保召回结果与查询高度相关,过滤掉不准确或噪音信息。 |
重排返回条数 | 前 5 条 | 精选最相关的结果呈现给用户,提高信息准确性。 |
SYSTEM_PROMPT | 按实测标定 | 需包含 CAR-T 临床试验预筛的专家角色设定与输出格式要求。 |
容易做错的三处
- 对话中出现无关的医学术语或数据,原因在于提示词未明确限定知识库范围或缺乏严格的意图识别。
- 模型回答未能准确引用临床试验的入排标准或疗效数据,原因在于知识库分段策略不当,导致关键信息被截断或语义缺失。
- 多轮对话后结果仍不精确,例如筛选出不符合特定不良事件
AE等级要求的试验,原因在于提示词对复杂逻辑条件的解析能力不足,未能将用户需求有效转化为查询语句。
怎么确认配好了
- 针对典型患者画像,执行多轮对话,核对最终筛选出的临床试验列表是否完全符合所有入排标准。
- 检查模型在对话中引用的所有数据点(如
CR率、AE等级、剂量)是否与原始知识库内容一致,无编造或篡改。 - 测试不同复杂度的医学术语查询,验证模型能否准确识别并关联到知识库中对应的字段或文本片段。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。