这个品类的数据长什么样
CAR-T 细胞治疗的质量文档主要来源于药品注册申报资料、生产批记录、质量标准、验证报告、SOP(标准操作规程)等。这些文档的更新频率受法规要求、工艺变更和临床试验进展影响,通常是阶段性集中更新。文档结构上,注册申报资料通常是多层级、交叉引用的大型 PDF 文档,包含大量图表、流程图和专业术语。生产批记录则多为结构化或半结构化的表格数据,记录了细胞扩增、转染、质控等关键步骤的参数和结果。质量标准文档则严格定义了产品检测指标、方法和限度。字段方面,常涉及细胞计数(单位:个/mL)、活率(单位:%)、基因拷贝数(单位:拷贝/μL)、病毒滴度(单位:TU/mL)等生物学和分子生物学指标。
这些特征在「文档解析与分块」这一环带来什么约束
CAR-T 细胞治疗质量文档的复杂性对文档解析与分块提出了特定要求。首先,多层级 PDF 文档中的图表和流程图,需要解析器能够准确识别图像并提取相关文字描述,避免信息丢失。其次,批记录中的结构化表格数据,要求解析器能正确识别行、列,并将其转换为可查询的结构化文本,确保后续问答的准确性。专业术语和缩写的大量存在,例如“CAR”、“lentivirus”、“GMP”,要求分块时保持上下文的完整性,避免因切分过细导致语义断裂。此外,数据更新的阶段性特点,意味着在批次更新时需要高效地进行增量解析和索引重建,以反映最新的质量状态。对于关键的质量指标和检测结果,分块时应确保其数值和单位不被拆分,维持数据的完整性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾专业术语和上下文完整性,避免过短切分导致语义丢失。 |
分段重叠长度 | 100 字符 | 确保段落间有足够重叠,衔接上下文,处理跨段落的专业术语。 |
解析模式 | 智能解析 | 应对 PDF 中图表、流程图和表格的复杂布局,提高信息提取准确性。 |
表格内容处理 | 结构化提取 | 针对生产批记录中的表格数据,确保行、列信息不丢失,便于查询。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 大型注册申报资料解析耗时较长,防止因超时导致解析失败。 |
字符清洗规则 | 保留特殊符号 | 许多生物医药术语包含特殊符号和上下标,保留有助于准确识别。 |
容易做错的三处
- 现象:上传 PDF 后,部分图表中的文字或表格数据无法被检索到。 原因:解析模式选择不当,未能有效识别图像内的文本或表格结构。
- 现象:批记录上传后,关于某个批次的关键参数(如细胞活率)的查询结果不完整,数值与单位分离。 原因:分段长度设置过小,导致数值和单位在切分时被拆开,丧失了完整性。
- 现象:文件上传后,解析节点长时间无响应或报错
504 Gateway Timeout。 原因:PARSE_FILE_TIMEOUT_SECONDS参数设置过低,大型或复杂文档解析时间超出限制。
怎么确认配好了
- 上传一份包含图表、表格和专业术语的典型 CAR-T 质量文档,检查解析后文本中这些元素的完整性和准确性。
- 针对一份结构化批记录文档,查询其中关键的数值型字段(如细胞数量、病毒滴度),验证其数值和单位是否一同被召回。
- 尝试上传一份文件大小接近系统上限的复杂 PDF 文档,观察解析过程是否顺利完成,未出现超时错误。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。