这个品类的数据长什么样
CAR-T 细胞治疗的注册申报资料涉及多方数据源。临床试验数据主要来源于医院的电子病历系统(EMR)和临床研究数据库,更新频率通常在试验阶段为每周,申报阶段则为最终锁定版本。生产工艺数据源自药企内部的生产执行系统(MES)和质量管理系统(QMS),数据更新相对稳定,主要在工艺优化或变更时发生。非临床研究数据多为实验报告,以 PDF 或 Word 文档形式存在。文献数据来自 PubMed、Web of Science 等专业数据库,更新频率较高。这些资料文档结构复杂,包含大量表格、图表和交叉引用。字段方面,涉及剂量单位(如 cells/kg)、生物标志物(如 CD19+ 细胞计数)、不良事件(如 CRS 等级)等特有术语。
这些特征在「多轮对话与提示词」这一环带来什么约束
CAR-T 细胞治疗申报资料的数据特征,对多轮对话与提示词的配置提出了特定要求。首先,复杂的文档结构和大量图表导致传统文本分块难以有效捕获上下文,需要更精细的文本预处理和嵌入策略。其次,特有的生物医药术语和单位要求模型具备更强的领域理解能力,提示词设计需明确术语定义,避免歧义。临床数据的实时性要求在多轮对话中能够动态更新或引用最新数据版本。多源异构数据意味着在对话过程中可能需要同时检索并整合来自不同系统的片段,提示词需引导模型进行跨文档信息聚合。此外,对安全性和有效性的严格审查,使得对话必须精准地引用原始数据和文献,对召回精度有极高要求。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500 字符 | 兼顾长文本语义完整性和检索效率,避免切分造成关键信息丢失,尤其对于临床试验报告。 |
召回条数 | 8 条 | 考虑到 CAR-T 资料的复杂性和多维度信息关联,适当增加召回条数以覆盖更多相关上下文。 |
相似度阈值 | 0.82 | 高阈值确保召回的文本片段与查询高度相关,减少无关信息干扰,对注册申报的严谨性至关重要。 |
maxContext | 6000 Token | 允许更长的对话历史和召回内容,支持复杂的多轮追问和信息整合,应对跨章节引用。 |
重排返回条数 | 5 条 | 对召回结果进行二次排序,优先展示最关键的证据,提高对话响应的精准度。 |
LLM 模型 | ERNIE-4.0 | 选用具备强大中文理解和逻辑推理能力的大模型,更准确地处理生物医药领域的专业术语和复杂句式。 |
容易做错的三处
- 对话中出现关键数据缺失或引用错误,原因是知识库分段策略不当,导致关键数字或单位被截断。
- 模型在多轮对话中对生物标志物或不良事件的解读前后不一致,原因是提示词未明确限定领域术语的上下文解释范围。
- 用户追问特定临床试验结果时模型无法给出具体数值,原因是原始文档中的表格数据未进行结构化抽取,导致检索不到。
怎么确认配好了
- 针对核心注册申报问题,进行多轮对话测试,检查模型引用的数据来源是否准确,并与原始文档进行比对,验证
相似度阈值的合理性。 - 随机抽取临床试验报告中的复杂表格数据,在对话中提问相关数值,核对模型返回结果的精度和完整性,以此评估
分段长度的有效性。 - 模拟申报审评人员的提问路径,观察模型在多轮对话中对特定CAR-T不良事件(如
CRS、ICANS)的解释是否始终保持一致,并检查maxContext的承载能力。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。