这个品类的数据长什么样
CAR-T 细胞治疗的临床试验数据主要来源于全球各临床试验注册库(如 ClinicalTrials.gov、EU Clinical Trials Register)以及相关学术期刊、会议报告。数据更新频率不一,注册库信息通常在试验进展到特定阶段后进行更新,部分研究数据可能滞后 6–12 个月。文档结构以半结构化和非结构化为主,包括试验方案、患者入组与排除标准、治疗流程、不良事件报告、疗效评估结果等。字段包含患者人口统计学信息、疾病诊断、CAR-T 产品类型、剂量、预处理方案、随访时间、主要与次要终点指标(如 客观缓解率、完全缓解率、无进展生存期、总生存期)。单位多样,例如 剂量 以 10^6 cells/kg 表示,随访时间 以月或年为单位。
这些特征在「部署与升级」这一环带来什么约束
CAR-T 细胞治疗数据的非结构化特性要求在部署时配置强大的文本解析能力,以有效提取关键信息。文档普遍较长且包含大量医学术语,对 分段长度 和 召回条数 的设置提出更高要求,避免重要上下文丢失。更新频率的差异意味着知识库需要支持增量更新和版本管理,防止旧数据干扰新数据。字段多样性和单位不统一,使得 相似度阈值 的调整需更为精细,以平衡召回率与准确率。例如,对不同 CAR-T 产品类型进行预筛时,需要准确识别产品名称及其关联的临床指标。处理这类数据时,模型需具备较强的语义理解能力,以应对医学术语的复杂性和多义性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | 临床试验方案和报告文件较大,需支持上传大文件。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 大型 PDF 文件解析耗时较长,需预留充足时间。 |
分段长度 | 800–1200 字符 | 医学文档上下文关联性强,保持较长分段以保留语义。 |
召回条数 | 前 8–12 条 | 确保覆盖多源信息,提高关键信息捕获率。 |
相似度阈值 | 0.75–0.85 | 平衡医学术语的精确匹配与潜在变体识别。 |
重排返回条数 | 前 5 条 | 优先展示最相关的核心信息,提高预筛效率。 |
容易做错的三处
- 升级后
问答拆分效果变差,导致预筛结果不准确。这通常是由于新版本的分词器或文本处理逻辑与旧版本存在差异,需要重新评估并调整分段长度等参数。 - 本地部署的模型在添加知识库后报错,状态码显示
403。这可能是令牌权限配置不当,或知识库文件路径、格式不符合模型要求,导致模型无法访问或解析知识库数据。 - PDF 文件解析失败,日志显示
错误信息。这通常与PARSE_FILE_TIMEOUT_SECONDS设置过短有关,或 PDF 文件本身包含复杂的图表、扫描件,需要更强的解析引擎支持。
怎么确认配好了
- 上传典型 CAR-T 临床试验方案 PDF 文件,检查
知识库文档列表中文件状态是否为“已完成解析”。 - 使用包含特定 CAR-T 产品名称和治疗指标的查询,验证召回结果是否包含多篇文档中的相关段落,并检查
召回条数是否符合预期。 - 输入一个包含错别字或同义词的医学术语,观察
相似度阈值是否能有效识别并召回相关信息。 - 针对患者入组标准等复杂查询,检查
重排返回条数中的内容是否高度聚焦于关键筛选条件。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。