这个品类的数据长什么样
CAR-T 细胞治疗研发文档主要来源于临床试验报告、研究论文、专利申请、内部实验记录和监管申报材料。这些文档更新频率较高,特别是临床试验数据,可能每月或每季度有阶段性更新。文档结构复杂,包含大量专业术语、生物学通路图、统计数据表格、图谱(如流式细胞术图、ELISA 曲线)和实验方法描述。字段与单位具有高度特异性,例如靶点名称(CD19、BCMA)、CAR 结构(scFv、铰链区、跨膜区)、细胞因子浓度(pg/mL)、细胞活力百分比、扩增倍数、病人队列信息(入组标准、排除标准)以及不良事件分级(CTCAE 标准)。
这些特征在「上下文与 token」这一环带来什么约束
CAR-T 研发文档的复杂结构和专业术语导致其信息密度高,单个段落可能包含多个关键实体和关系。这意味着在分段时,需要确保语义完整性,避免关键信息被截断。图谱和表格的嵌入文本化处理会显著增加 token 数量,对 maxContext 设定提出挑战。高频更新的临床数据要求知识库能快速同步,并确保检索时能获取最新版本,这影响了索引策略和 召回条数 的选择。此外,特异性字段和单位的存在,要求模型对这些领域知识有深度理解,否则可能在问答中产生歧义或误解,需要通过精确的 相似度阈值 和 重排返回条数 来筛选相关性最高的片段。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾语义完整性与 token 效率,避免关键信息被切断,同时限制单段 token 数量。 |
召回条数 | 前 8–12 条 | CAR-T 文档关联性强,增加召回可覆盖更多潜在相关信息,应对复杂查询。 |
相似度阈值 | 0.78–0.85 | 领域术语高度相似,提高阈值可有效过滤通用性高但实际不相关的段落。 |
重排返回条数 | 3–5 条 | 在高召回量基础上,通过重排精选出最核心的少数片段供 LLM 进一步处理。 |
maxContext | 按实测标定 | 需根据实际使用的 LLM 模型上下文窗口上限,并留有系统指令和用户查询的空间。 |
UPLOAD_FILE_MAX_SIZE | 200 MB | 考虑临床试验报告和专利文件可能包含大量图片和表格,文件体积较大。 |
容易做错的三处
- 查询结果显示上下文为空或不完整:原因可能是
分段长度过短导致关键信息被截断,或者相似度阈值过高过滤掉了相关但相似度略低的段落。 - 模型回答出现事实性错误或遗漏关键细节:这通常是由于
召回条数不足,未能提供足够多维度的上下文信息给大模型。 - 上传大文件时出现超时或失败:可能是
UPLOAD_FILE_MAX_SIZE或PARSE_FILE_TIMEOUT_SECONDS配置过小,无法处理大型或结构复杂的研发文档。
怎么确认配好了
- 选取多个典型 CAR-T 研发查询,检查
知识库检索模块的预览结果,确保召回的段落语义完整且包含查询所需的核心信息。 - 比对
相似度分数最高的几条召回,确认其内容与查询意图高度匹配,没有泛泛而谈的段落混入。 - 在
应用中进行模拟问答,核查模型回答是否准确引用了召回上下文中的关键数据、靶点名称或实验结果,并检查引用的段落编号是否正确。 - 上传一份包含复杂表格和图谱的临床试验报告,观察文件处理过程是否顺利完成,并检查其索引后的
分段内容是否准确反映了原始文档结构。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。