这个品类的数据长什么样
CAR-T 细胞治疗临床试验数据主要来源于临床试验注册平台(如 ClinicalTrials.gov、中国临床试验注册中心)、研究者手册、医学期刊论文以及药企内部报告。数据更新频率较高,新试验注册、患者招募状态变更、研究结果发布等事件均会触发更新,通常以周或月为单位进行。文档结构以半结构化和非结构化数据为主。半结构化数据体现为试验方案、患者入排标准、不良事件报告等,包含明确的字段如 NCT 号、适应症、干预措施、疾病分期、既往治疗史。非结构化数据则存在于试验描述、研究背景、讨论部分。字段与单位的特殊性在于,剂量单位常涉及 细胞数/kg 或 细胞数/m²,时间单位会细化到 周、月、年,且常伴随 随访期 等概念。
这些特征在「知识库检索与召回」这一环带来什么约束
CAR-T 临床试验数据的高更新频率要求知识库具备高效的增量更新机制,以确保检索结果的时效性。半结构化数据的存在,使得传统的全文检索不足以满足精确匹配需求,需要结合结构化信息进行过滤和排序。例如,精确检索特定 疾病分期 的试验,仅依靠文本相似度难以实现。非结构化数据中的关键信息提取,如 既往治疗史 的复杂描述,对分词和实体识别提出了更高要求。剂量单位和时间单位的细化,意味着需要支持数值范围查询和单位转换,例如检索 剂量大于 5x10^6 细胞/kg 的试验。此外,患者入排标准中的多重条件组合,要求检索逻辑能够处理复杂的布尔运算和嵌套条件,以精确匹配预筛需求。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 临床试验文档的段落通常包含多个关键信息,过短分段易丢失上下文,过长则引入噪声。 |
召回条数 | 10–15 条 | 初步召回需要覆盖足够多的潜在相关试验,以便后续重排和过滤。 |
相似度阈值 | 按实测标定 | 针对 CAR-T 试验的专业术语和缩写,阈值需在保证召回率与精确率之间取得平衡。 |
重排返回条数 | 3–5 条 | 最终呈现给用户的结果应高度相关且精炼,避免信息过载。 |
最大文件大小 | 100 MB | 考虑研究者手册和详细报告的体积,确保能够上传大型 PDF 文档。 |
嵌入模型 | bge-large-zh 或 text-embedding-ada-002 | 选用在医学领域有较好表现的嵌入模型,提升专业术语的语义理解。 |
容易做错的三处
- 检索结果包含大量无关试验,现象是
召回条数很多但相关性不高。原因在于相似度阈值设置过低,导致大量低相关度文档被召回,或者分段策略不合理,关键信息被拆散。 - 查询特定剂量的试验时,系统无法正确识别数值范围或单位,导致
结果为空。原因在于知识库没有针对 CAR-T 领域特有的剂量单位和数值范围进行专门的实体识别或解析配置。 - 更新后的临床试验数据未能及时反映在检索结果中,现象是
最新状态与实际不符。原因在于知识库的增量同步机制未有效配置或触发,导致数据新鲜度不足。
怎么确认配好了
- 选取一批具有明确入排标准的 CAR-T 临床试验案例,构造查询语句,检查
重排返回条数中的试验是否准确匹配。 - 针对不同剂量范围和单位的查询,例如
CD19 CAR-T 剂量 > 5e6 细胞/kg,验证系统是否能正确召回目标试验,并检查剂量字段的解析精度。 - 模拟一次 CAR-T 临床试验的状态更新(例如招募状态从
招募中变为已完成),在知识库更新后立即查询,确认状态变更是否已生效。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。