这个品类的数据长什么样
CAR-T 细胞治疗产品的数据主要来源于临床试验报告、药品说明书、监管审批文件、学术论文和专利文献。这些文档的更新节奏与产品生命周期和监管要求紧密相关,例如临床试验结果可能每月或每季度更新,药品说明书则在获批上市后有年度修订或在安全性信息更新时发布补充件。文档结构通常高度规范化,例如 ICH E3 临床研究报告、FDA 产品说明书模板等,包含固定的章节和数据呈现格式。字段上涉及复杂的生物学、医学术语,如靶点表达、细胞扩增倍数、药代动力学参数、不良事件发生率等。单位则涵盖细胞浓度(例如 cells/kg)、剂量(例如 mg/kg)、时间(例如 天、月)以及各种生物标志物浓度(例如 pg/mL)。
这些特征在「文档解析与分块」这一环带来什么约束
CAR-T 细胞治疗产品文档的高度规范化结构,使得基于章节标题和语义内容的混合分块策略更为有效。由于涉及大量专业术语和复杂数据表,传统的文本分块可能导致关键信息被截断或上下文丢失,因此需要更精细的段落边界识别和表格内容提取。文档更新的周期性要求知识库具备增量更新和版本管理能力,确保解析内容的时效性。此外,不同来源文档中可能存在同义词、缩写或单位不一致的情况,对解析后的实体识别和标准化提出了挑战。例如,CD19 靶点在不同文献中可能以多种形式出现,需要统一处理。同时,临床试验数据中的数值范围和单位转换,也要求解析器能处理复杂的数值信息。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾CAR-T文档中专业术语的上下文关联性和大段落的完整性,避免关键信息被切割。 |
分段重叠长度 | 100–150 字符 | 确保相邻分块之间有足够的上下文衔接,特别是在描述复杂生物学机制或临床结果时。 |
解析模式 | 结构化解析优先,辅以语义分块 | 充分利用CAR-T文档的标准化章节结构,对表格、图注等进行独立处理。 |
表格解析策略 | 识别表格边界,按行或按列提取数据,并保留表头信息 | 确保临床数据、不良事件统计等表格中的数值和描述性信息准确无误。 |
超时时间 (PARSE_FILE_TIMEOUT_SECONDS) | 600 秒 | 考虑到大型临床试验报告(例如 100MB 以上的 PDF 文件)的解析时间可能较长。 |
图片OCR识别 | 开启 | 许多CAR-T文档中包含关键的流式细胞术图、组织病理学图片或结构式图,需要提取图片中的文本信息。 |
容易做错的三处
- 解析状态长时间停留在“解析中”或最终显示“解析失败”,这可能是因为上传的 PDF 文件过大或内容过于复杂,导致解析器处理时间超出
PARSE_FILE_TIMEOUT_SECONDS设置。 - 解析结果中关键的临床试验数据表内容缺失或混乱,通常是因为表格解析策略未针对CAR-T文档的复杂表格结构进行优化,未能正确识别表头或数据单元格。
- AI 回答中出现专业术语的误解或上下文缺失,这往往是
分段长度设置不当,导致相关联的生物学概念或治疗方案描述被不合理地切分到不同块中。
怎么确认配好了
- 选取多份不同来源(如 FDA 说明书、临床试验报告)的 CAR-T 文档进行上传解析,检查其解析状态是否均显示“就绪”。
- 随机抽取解析后的文档,核对其关键章节(如“作用机制”、“临床研究”、“不良反应”)的分块是否完整且语义连贯,特别是其中的表格数据是否被正确提取。
- 针对解析后的知识库,进行包含专业术语和数值查询的测试,评估召回结果的准确性和完整性,例如查询“CD19 阳性患者的完全缓解率”或“tisagenlecleucel 的推荐剂量”。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。