这个品类的数据长什么样
siRNA 核酸药的质量文档主要源自研发阶段的实验报告、生产过程的批次记录、以及法规提交材料。这些文档更新频率较高,尤其在临床试验和生产工艺优化阶段。文档结构复杂,通常包含大量图表、化学结构式、序列信息和实验数据。例如,稳定性研究报告会包含多个时间点的检测数据,纯度分析报告会涉及高效液相色谱(HPLC)图谱。字段上,常见的有 批次号、检测项目、检测方法、结果、单位(如 nM、%、OD、ng/mL),以及 QbD(质量源于设计)相关参数。这些文档的语言专业性强,常混杂英文缩写与中文描述。
这些特征在「文档解析与分块」这一环带来什么约束
siRNA 核酸药质量文档的复杂性对文档解析与分块提出了多重约束。首先,图表和化学结构式需要特殊的图像识别或文本提取技术,传统基于纯文本的分块方法难以有效处理。其次,文档中大量的专业术语和缩写,要求分块时能保持术语的完整性,避免因断词导致语义丢失。例如,2'-O-甲基修饰 或 GalNAc 偶联结构应作为一个整体被识别。此外,批次记录和实验数据常以表格形式呈现,表格内部的数据关联性必须在分块时得到维护,否则会割裂上下文。更新频率高意味着需要高效的增量解析与更新机制,以确保知识库的时效性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾 siRNA 术语的长度与上下文完整性,避免过短分段导致语义碎片化。 |
分段重叠长度 | 150–250 字符 | 保留足够上下文信息,确保相邻分块间的语义连贯性,尤其在表格或序列描述处。 |
文件类型白名单 | ['.pdf', '.docx', '.xlsx', '.json'] | 覆盖 siRNA 质量文档主要的文件格式,包括报告、数据表和结构化数据。 |
启用表格智能解析 | True | 有效提取 Excel 和 PDF 中表格数据,并将其转化为结构化文本,维护数据关联。 |
OCR 文本识别精度阈值 | 0.85 | 确保从扫描件或图像中提取的专业术语和数据具有较高准确性。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型报告或包含复杂图表的文档解析耗时,避免因超时导致解析失败。 |
容易做错的三处
- 文档上传后显示部分
chunk向量化异常,现象通常是向量化服务返回HTTP 500或embedding结果为空。原因在于文档中存在过长或包含特殊字符的文本段,超出了向量模型单次处理的输入长度限制。 - 多轮对话中对特定批次的查询,返回结果包含不完整的实验数据或错误的单位。现象为 DB 节点查询结果 JSON 数组中缺少关键字段,或者
unit字段为空。原因在于 Excel 或 PDF 表格解析时,未能正确识别表头与数据行的对应关系,或将不同列的数据错误地合并。 - 更新后的质量文档,查询时仍然返回旧的信息,导致数据不一致。现象是知识库召回内容与最新文档内容不符,
更新时间戳字段未更新。原因在于文档解析系统未正确触发增量更新流程,或缓存机制导致旧数据未及时失效。
怎么确认配好了
- 上传具有代表性的 siRNA 质量文档(如稳定性报告、批次放行报告),在知识库管理界面检查每个
chunk的内容是否完整,尤其是专业术语、序列信息和表格数据是否被正确提取。 - 使用包含特定批次号、检测项目和结果的查询语句进行测试,验证返回的 JSON 结果中关键字段(如
批次号、检测项目、结果、单位)是否准确且完整,并与原始文档进行比对。 - 尝试上传一个包含大量图表和复杂排版的 PDF 文档,检查 OCR 识别的文本内容是否清晰可读,无明显错别字或乱码,并通过比对原始图像确认识别精度。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。