这个品类的数据长什么样
CAR-T 细胞治疗产品的数据来源多样,主要包括临床试验报告、药品说明书、研究论文、监管机构(如 FDA、EMA)数据库以及专利文献。这些数据更新频率不一,临床试验数据通常在研究进展或结果发布时更新,药品说明书随版本迭代而变化,而研究论文则持续发表。文档结构呈现高度专业化,包含详细的药理学、药代动力学、临床疗效与安全性数据。字段方面,特异性地涵盖靶点抗原、转导载体类型、细胞制备工艺、剂量(例如 细胞数/kg)、给药方案、不良事件发生率(如 CRS 等级、ICANS 发生率)等。单位则严格遵循生物医学标准,例如 10^6 细胞/kg、mg/kg、%、天。
这些特征在「表单与交互」这一环带来什么约束
CAR-T 细胞治疗产品数据的专业性和复杂性,对表单与交互设计提出了特定要求。数据来源的分散性意味着系统需要支持多源异构数据的导入与整合,并能处理不同文档格式(如 PDF、HTML、XML)。更新频率的不确定性要求 RAG 知识库具备灵活的数据同步机制,能够定期检查并更新相关数据。文档结构的复杂性决定了在信息提取时,需要对嵌套结构、表格数据和非结构化文本进行精确解析,例如从临床试验报告中准确识别 主要终点、次要终点 及 不良事件 数据。字段与单位的严格性要求表单输入时需提供精确的单位提示和校验规则,防止因单位错误导致的数据混淆。此外,大量专业术语的存在,使得表单交互设计需要支持术语的智能提示与解释,减少用户输入障碍。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | 临床试验报告和药品说明书常包含大量图表与详细文本,文件体积较大,需要支持大文件上传。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理复杂的 PDF 文档,尤其是包含大量表格和扫描图像的,解析耗时较长。 |
分段长度 | 800 字符 | CAR-T 治疗产品描述中的关键信息密度较高,过短分段可能切断上下文,过长则降低召回精度。 |
召回条数 | 前 8 条 | 保证在复杂查询中能覆盖到多个维度的相关信息,如疗效、安全性、适应症等。 |
相似度阈值 | 0.75 | 确保召回的片段与用户查询高度相关,避免引入大量噪声信息,影响 CAR-T 产品的准确性判断。 |
实体识别模型 | 专有模型 | 针对 CAR-T 靶点、细胞类型、不良事件等专业实体,通用模型召回精度不足,需特定训练。 |
容易做错的三处
- 用户输入专业术语时系统无法识别或给出错误提示,原因在于RAG知识库缺乏针对生物医药领域,特别是CAR-T治疗相关的专业词汇表和实体识别能力。
- 查询结果中,关于CAR-T产品剂量或不良事件发生率的数据出现单位混淆或缺失,原因在于数据摄取时未对不同来源的字段单位进行标准化处理,或解析器未正确提取单位信息。
- 在多轮对话中,AI 无法根据上下文持续追问 CAR-T 产品的具体制备工艺细节,原因在于知识库分段策略过于粗糙,导致相关信息被截断或分散,缺乏连贯性。
怎么确认配好了
- 选取 5 份不同来源的 CAR-T 产品说明书或临床报告,上传至系统,检查文件解析是否完整,关键字段(如
靶点、适应症、不良事件)是否被正确识别和提取。 - 构建 10 个包含专业术语的复杂查询,例如“某个 CAR-T 产品对特定淋巴瘤的
ORR是多少?”,验证 AI 回答的准确性、完整性,并检查引用来源的正确性。 - 模拟用户进行多轮对话,围绕某个 CAR-T 产品的制备流程、剂量调整或安全性管理进行深入提问,评估 AI 能否保持上下文一致性并提供连贯的专业解答。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。