这个品类的数据长什么样
生物医药领域的 CMC(化学、制造与控制)研究产品文档,主要来源于药物研发过程中的实验记录、批生产记录、质量标准、分析方法验证报告、稳定性研究报告以及注册申报资料等。这些文档通常以 PDF 格式为主,部分可能存在扫描件。数据更新频率在药物研发的不同阶段有所不同,从研发早期的快速迭代到临床后期和上市后的周期性更新。文档结构严谨,包含大量表格、图谱、流程图和专业术语,字段如批号、规格、含量、杂质、溶出度等具备强烈的行业特异性,且数值常带有明确的单位和检测方法。
这些特征在「文档解析与分块」这一环带来什么约束
CMC 文档的严谨结构和专业术语对解析精度提出较高要求,普通的文本提取可能导致关键信息丢失或错位。大量的表格和图谱使得单纯的文本分块难以有效保持信息的完整性和上下文关联。例如,一个批次的关键质量属性可能分散在多个表格和描述性文本中。扫描件的存在增加了 OCR 识别的挑战,可能引入字符错误。此外,字段的特异性和单位的精确性要求分块后仍能准确识别和关联,避免语义漂移。文档更新频率要求平台具备高效的文档版本管理和增量更新能力,以避免重复解析和资源浪费。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | CMC 文档,尤其是注册申报资料,文件体积通常较大,需要更高的上传限制。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 复杂 PDF 文档,特别是包含大量表格和图谱的扫描件,解析耗时较长,增加超时时间以避免解析中断。 |
分段长度 | 800–1200 字符 | 考虑到 CMC 报告中段落的完整性和上下文关联,较大的分段长度有助于保留关键信息,例如一个实验步骤或一个质量标准的完整描述。 |
重叠长度 | 100–200 字符 | 适当的重叠长度有助于在分块边界处保留上下文,避免信息割裂,尤其在专业术语和数据表格之间。 |
召回条数 | 前 8 条 | 确保召回足够的上下文信息,覆盖 CMC 研究中可能涉及的多个相关参数和实验数据,以提高检索准确性。 |
相似度阈值 | 按实测标定 | 针对 CMC 专业术语和数据特点,通过小批量测试调整,确保高相关性结果被召回,同时过滤掉不相关的通用文本。 |
重排返回条数 | 前 5 条 | 经过重排后,精选出最相关且上下文完整的片段,优化最终呈现给用户的回答质量。 |
容易做错的三处
- 解析超长 PDF 文件时出现
504 Gateway Timeout错误,原因是PARSE_FILE_TIMEOUT_SECONDS参数设置过低,未能覆盖大型文档的解析时间。 - 表格数据被错误地解析成无序文本,导致关键数值和单位丢失,这是由于文档解析器未针对复杂表格结构进行优化,或者分块策略过于简单。
- 召回结果中出现大量无关或重复的片段,影响回答质量,这通常是
相似度阈值或重叠长度设置不当,未能有效区分核心信息与背景描述。
怎么确认配好了
- 选取包含复杂表格和图谱的典型 CMC 报告,观察解析后的分块内容,确保表格结构和关键字段信息保持完整。
- 上传并解析一个体积接近
UPLOAD_FILE_MAX_SIZE限制的超大文档,检查解析过程是否能顺利完成,没有超时报错。 - 针对文档中的特定批次号、检测方法或质量标准进行提问,评估召回片段是否精准包含所需信息,并能支持生成准确的回答,根据回答质量调整
相似度阈值。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。