这个品类的数据长什么样
CAR-T 细胞治疗的注册申报资料数据来源广泛,主要包括临床试验报告、非临床研究数据、生产质控文档、药品说明书草案以及监管机构发布的指南文件。临床试验数据更新频率较高,尤其是在多中心、多阶段试验中,数据递交存在批次性。非临床数据如药理毒理报告则相对稳定。文档结构上,通常遵循 ICH E3 临床研究报告结构或 CTD (Common Technical Document) 格式,包含严格的章节编号和附录。字段方面,涉及剂量、给药方案、疗效指标(如完全缓解率、无进展生存期)、不良事件编码(MedDRA)、细胞制备批次信息等。单位涉及剂量单位(如 10^6 cells/kg)、时间单位(天、周、月)、浓度单位(ng/mL)等,且对数据精度有严格要求。
这些特征在「工作流编排」这一环带来什么约束
CAR-T 细胞治疗注册申报资料的复杂数据特征对工作流编排提出了具体约束。高频更新的临床数据要求工作流具备增量更新和版本管理能力,避免重复处理历史数据。严格的文档结构和多样的文件格式(PDF、Word、Excel)决定了预处理环节需要强大的文档解析能力,例如对表格和嵌入图表的识别。CTD 格式的强制性要求工作流在信息提取后能够自动映射到预设的申报模块。字段的特异性和高精度要求,例如 MedDRA 编码,意味着需要集成专业术语词典或使用定制化的实体识别模型。剂量和时间单位的标准化处理,例如将不同文献中的单位统一,需要工作流具备单位转换和校验机制,确保数据一致性。当联网搜索获取最新监管政策时,工作流需要能处理非结构化文本并从中提取关键条款。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 平衡上下文完整性与检索效率,避免单个分段过长稀释核心信息,过短丢失语境。 |
召回条数 | 前 5 条 | 确保覆盖相关性最高的知识点,同时控制 LLM 输入 token 数量,减少无关信息干扰。 |
相似度阈值 | 0.78 | 根据生物医药领域术语的精确性要求,设定较高阈值以提高召回准确性,降低误报。 |
重排返回条数 | 前 3 条 | 在初次召回基础上进行二次筛选,聚焦最相关的证据片段,提升最终结果的精准度。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型临床报告(如 200 MB 以上 PDF)的复杂解析,防止因超时导致处理中断。 |
maxContext | 4096 tokens | 适应长篇幅申报资料的分析需求,提供足够大的上下文窗口以支持复杂逻辑推理。 |
容易做错的三处
- 工作流中知识库搜索返回为空或结果不相关,原因是没有正确配置文档预处理阶段的文本分段策略,导致关键信息被截断或上下文不完整。
- AI 对话中未能引用知识库内容,而是产生“幻觉”回答,原因是相似度阈值设置过低,导致召回了大量不相关的低质量分段,干扰了 LLM 的判断。
- 处理大型临床试验报告时,文件上传或解析失败,原因是
UPLOAD_FILE_MAX_SIZE或PARSE_FILE_TIMEOUT_SECONDS参数过小,无法应对500 MB甚至1 GB级别的复杂 PDF 文档。
怎么确认配好了
- 上传一份包含关键剂量、疗效指标和不良事件的临床试验报告,检查知识库中是否能准确提取并索引这些字段,尤其关注 MedDRA 编码和单位。
- 构建一个包含特定查询(例如“某药物在儿童淋巴瘤中的缓解率”)的测试用例,验证工作流的检索结果是否能准确召回相关文档片段,并将其作为 LLM 回答的依据。
- 执行模拟申报材料分析任务,核对 LLM 生成的分析报告,确认其是否遵循了预设的 CTD 章节结构,且内容与原始资料保持一致,无关键信息遗漏或事实性错误。
- 尝试上传一个
300 MB左右的 PDF 文档,观察文件上传和解析过程是否顺畅,并检查日志输出,确认没有出现超时或内存溢出错误。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。