这个品类的数据长什么样
小分子化药的制度与标准操作规程(SOP)文档主要来源于药监机构发布的法规、药企内部的研发、生产、质量控制及临床试验规程。这些文档的更新频率通常较低,但一旦更新,往往具有强制性和全局影响。文档结构以层级分明的章节、条款为主,常包含大量专业术语、缩写、图表和流程图。字段方面,涉及剂量、浓度、批次、有效期、温度、压力等,单位严谨且多样化,如毫克(mg)、微摩尔(µmol)、摄氏度(℃)、帕斯卡(Pa)等。文件格式以 PDF 和 DOCX 为主,部分早期文档可能为扫描件。
这些特征在「文档解析与分块」这一环带来什么约束
小分子化药制度文档的层级结构要求解析时能有效识别章节边界,避免跨章节的语义混淆。专业术语和缩写的密集出现,意味着分块时需保持上下文的完整性,确保术语的解释或相关定义能与使用场景一同召回。图表和流程图的存在,对纯文本解析提出了挑战,可能需要额外的图像识别或人工标注来提取关键信息。严谨的字段和单位,要求分块内容能清晰呈现关键参数,并保留其计量单位,以防止信息在召回时被误解或丢失。更新频率低但影响大的特点,使得对历史版本文档的管理和索引同样重要,确保问答结果基于当前生效的制度版本。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾专业术语上下文完整性与单段信息密度,避免过长导致召回效率降低。 |
重叠长度 | 100–200 字符 | 确保相邻分段语义衔接,减少因分段边界导致的语义断裂,尤其在流程描述中。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型或复杂格式的 PDF/DOCX 文档解析,避免因超时导致解析失败。 |
UPLOAD_FILE_MAX_SIZE | 100 MB | 适应可能包含大量图表或高分辨率扫描件的制度文档,确保文件上传无障碍。 |
分隔符 | \n\n (双换行符) 和 . (句点加空格) | 制度文档常以段落或句子为基本语义单元,此分隔符能有效识别。 |
maxContext | 3000 Tokens | 确保在问答时能加载足够多的上下文信息,以应对包含复杂逻辑或多步骤流程的问题。 |
容易做错的三处
- 上传大型 PDF 文档时提示超时,原因是
PARSE_FILE_TIMEOUT_SECONDS配置过低,未能给复杂文档留足解析时间。 - 问答结果未能准确引用知识库原文,而是进行了 AI 模型的改写,原因是没有正确配置召回策略或
相似度阈值设置不当。 - 部分 DOCX 文档解析失败或内容缺失,通常是由于文档中存在不标准格式的嵌入对象(如特殊宏或非文本图层),导致解析器无法识别。
怎么确认配好了
- 上传一份包含多章节、图表和专业术语的典型制度文档,检查知识库中的分块预览,确认分段长度、重叠部分以及章节边界是否合理。
- 针对文档中的关键规定、特定参数值或操作流程提问,验证问答结果是否能准确召回原文相关段落,并保留原始的字段和单位信息。
- 上传一个已知解析失败的文档(如超大文件或复杂格式文件),调整
PARSE_FILE_TIMEOUT_SECONDS和UPLOAD_FILE_MAX_SIZE参数后重新尝试,确认报错现象是否消失。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。