这个品类的数据长什么样
CAR-T 细胞治疗的制度文档主要来源于国家药品监督管理局(NMPA)发布的法规、技术指导原则,以及各医疗机构、制药企业内部制定的标准操作规程(SOP)、质量管理体系文件。这些文档通常以 PDF 格式为主,包含大量专业术语、图表、流程图和复杂的审批要求。更新频率受政策法规调整和临床实践进展影响,通常为季度或年度更新,但涉及重大安全性或有效性变更时可能临时更新。文档结构严谨,层级分明,章节标题、条款编号清晰。字段和单位方面,涉及细胞制备批次、患者识别码、制剂剂量、培养时间、质控指标(如细胞活力、纯度、基因拷贝数)等,单位精确到微克、毫升、小时等。
这些特征在「文档解析与分块」这一环带来什么约束
CAR-T 细胞治疗制度文档的专业性、结构化特点以及更新频率,对文档解析与分块提出了具体要求。文档中包含的复杂图表和流程图,使得纯文本提取可能丢失关键信息,需要 OCR 或图像解析能力辅助。严格的章节编号和条款划分,要求分块时能有效保留原文的逻辑结构,避免语义割裂。文档中常出现的表格数据,例如质控指标,需要特殊处理以保持其上下文完整性。此外,政策法规的定期更新,意味着知识库需要支持增量更新和版本管理,确保检索到的信息始终是最新且有效的。对特定字段和单位的识别,有助于后续问答系统精准理解用户查询,避免因单位混淆导致的错误。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾语义完整性与召回效率,避免单个分块过长导致信息冗余或过短丢失上下文。 |
分段重叠长度 | 50–100 字符 | 确保分块边界的上下文连续性,减少因断句导致的关键信息丢失。 |
OCR_ENABLED | True | CAR-T 文档常含图表、流程图,开启 OCR 有助于提取非文本信息。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型 PDF 文档或复杂 OCR 任务可能耗时较长,增加超时限制。 |
CHUNK_STRATEGY | 按标题与段落 | 优先依据文档的章节标题和段落结构进行分块,保持逻辑完整。 |
TABLE_EXTRACTION_MODE | 结构化文本 | 保留表格的行列关系,以便后续检索时能准确理解表格数据。 |
容易做错的三处
- 解析大型 PDF 文件时出现
PARSE_FILE_TIMEOUT错误,原因为默认超时时间不足以处理包含大量图片或复杂排版的文档。 - 上传包含关键表格数据的 XLSX 文件后,问答结果中表格内容缺失或混乱,原因为表格解析模式未设置为保留结构化信息。
- 用户提问涉及某个制度版本时,系统返回的答案不准确,原因为知识库未进行版本管理,或增量更新策略未能有效处理旧版本文档的替换。
怎么确认配好了
- 上传一份包含复杂流程图的 PDF 文档,检查解析后的分块中,流程图中的文字是否被正确提取并纳入文本内容。
- 上传一份包含多行质控表格的 XLSX 文档,检查解析后的分块中,表格数据是否以结构化的形式(例如 Markdown 表格)呈现。
- 上传一个新版 SOP 文档,随后检索与该 SOP 相关的条款,确认问答结果来源于最新版本,并能区分新旧版本的差异。
- 随机抽取文档中的专业术语或关键句子进行检索,检查召回的分块是否语义完整,且能够溯源到原始文档的对应位置。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。