这个品类的数据长什么样
CAR-T 细胞治疗临床试验的数据主要来源于临床研究机构提交的各类申办方文档和监管机构发布的公开资料。这些文档更新频率相对较低,通常随试验进展或报告周期发布,例如年度报告、中期分析报告、最终研究报告等。文档结构复杂,包含协议、知情同意书、病例报告表(CRF)、研究者手册(IB)、伦理审查批件、以及各类实验室检测报告。字段类型多样,涵盖患者基本信息、诊断标准、治疗方案、剂量调整、不良事件、疗效评估指标(如完全缓解率 CR、部分缓解率 PR)、细胞制备细节、基因编辑信息、生物标志物数据等。单位则涉及剂量(如 cells/kg)、时间(如 months、weeks)、百分比(如肿瘤负荷减少 %)以及各类实验室检测值(如 pg/mL、IU/mL)。
这些特征在「文档解析与分块」这一环带来什么约束
CAR-T 临床试验文档的复杂性对文档解析提出了高要求。多源性导致文档格式不统一,可能存在 PDF、Word、结构化表格甚至扫描件混合的情况,需要支持多种文件类型的有效识别和信息抽取。字段的专业性和多样性,特别是带有特定生物学或医学缩写的数据,要求解析器具备高度语义理解能力,避免将关键指标误识别为普通文本。例如,CR 既可能指完全缓解,也可能是其他医学缩写,需要结合上下文判断。低更新频率意味着初期解析准确性至关重要,一旦错误可能长期影响后续预筛结果。此外,大量表格和嵌套列表的存在,使得传统基于规则或简单文本分段的方法难以准确捕获数据间的关联性,可能导致关键信息被割裂,影响后续向量化和检索的准确性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | 临床试验文档常包含大量图表和图片,文件体积较大,需要足够的上传容量。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型 PDF 或包含复杂表格的 Word 文档可能耗时较长,避免解析超时。 |
分段长度 | 800–1200 字符 | 平衡上下文完整性与检索效率,确保每个分段包含足够信息用于语义理解,并降低无关信息干扰。 |
分段重叠长度 | 100–200 字符 | 确保分段边界处的信息连续性,减少因分段导致的关键信息割裂。 |
最大分段数 | 1000 | 限制单个文档生成的分段数量,防止超长文档消耗过多资源,并确保检索结果的可管理性。 |
表格解析模式 | 智能解析 | 临床文档中表格结构复杂且嵌套,智能解析模式能更好地识别表格边界和单元格内容,保持数据结构。 |
容易做错的三处
- 文档解析后关键字段(如不良事件等级、疗效评估结果)为空,原因可能是解析器未能识别特定医学术语或缩写,或表格结构过于复杂导致数据提取失败。
- 上传大型 PDF 文件时出现
504 Gateway Timeout错误,原因通常是PARSE_FILE_TIMEOUT_SECONDS设置过短,文件解析时间超出允许范围。 - 检索结果中出现大量不相关的分段,原因可能是
分段长度过长,导致单个分段包含过多噪声信息,稀释了关键语义。
怎么确认配好了
- 选取多个典型 CAR-T 临床试验文档,上传并检查解析后的文本内容,特别是其中包含的专业术语、剂量单位和表格数据是否完整且准确。
- 针对解析后的文档,进行关键词和语义检索,观察返回结果中是否包含目标信息所在的分段,并评估分段的上下文完整性。
- 检查系统日志,确认在处理各类文档时没有出现超时或其他解析错误信息,特别是针对大文件或复杂格式的文件。
- 核对关键字段的提取情况,例如从解析结果中随机抽取若干不良事件报告,验证其等级和描述是否与原始文档一致,并据此调整
表格解析模式和分段长度等参数。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。