这个品类的数据长什么样
siRNA 核酸药产品的数据主要来源于研发报告、临床试验文件、生产批次记录、质控标准以及药品说明书。这些文档通常以 PDF、Word 或结构化文本形式存在。更新频率方面,研发阶段的文档更新较为频繁,可能每周甚至每天都有新的实验数据和分析报告;临床试验数据则按阶段更新;上市后的产品说明书和质控标准更新相对稳定,通常是年度修订或根据监管要求进行。文档结构方面,多数报告包含大量表格、图谱和专业术语,如序列信息、修饰位点、剂量单位(如 nM、µg/kg)、靶点基因名称、作用机制描述、稳定性数据和毒理学报告。
这些特征在「文档解析与分块」这一环带来什么约束
siRNA 核酸药文档的专业性和复杂性对文档解析与分块提出了特定要求。首先,表格和图谱的普遍存在意味着单纯的文本提取可能丢失关键的结构化信息,需要支持多模态解析能力。其次,高频次的研发文档更新要求解析系统能够快速识别并处理增量内容,避免重复解析。文档中包含的序列信息、化学结构式和特定单位(如 nM)是理解药物性质的核心,分块时需要确保这些关键信息不被割裂,同时能识别并保持其上下文关联。专业术语和缩写密集,要求解析模型具备一定的领域知识,以避免误解或不准确的分块,影响后续的检索准确性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | 考虑到包含大量图谱和表格的研发报告或临床试验报告文件体积较大。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型 PDF 文件,特别是包含复杂布局和扫描图像时,需要较长的解析时间。 |
分段长度 | 800–1200 字符 | siRNA 药物作用机制和实验数据描述通常较长,需要足够上下文来理解。 |
分段重叠长度 | 100 字符 | 确保关键信息(如序列、靶点)在不同分块之间有足够的上下文衔接。 |
自定义分隔符 | \n\n、###、--- | 研发报告和技术文档常使用这些分隔符来组织章节和逻辑段落。 |
表格解析模式 | 结构化提取 | 确保表格中的 siRNA 序列、剂量、实验结果等结构化数据被准确识别和保留。 |
容易做错的三处
- 上传大型 PDF 文档时提示解析失败,原因是
PARSE_FILE_TIMEOUT_SECONDS参数设置过短,未能完成对复杂结构文档的全部解析。 - 知识库检索结果中,同一 siRNA 序列的关键修饰信息被分割到不同段落,原因是
分段长度过小且分段重叠长度不足,导致重要上下文被截断。 - 上传 Excel 表格文件后发现内容未被正确识别并导入知识库,原因是系统默认的文件解析器不支持
xlsx格式的结构化数据提取,仅支持文本内容。
怎么确认配好了
- 上传多个包含复杂表格和图谱的 siRNA 研发报告 PDF,检查解析后的分块内容是否完整保留了表格数据和关键图谱说明。
- 针对包含长序列信息和详细作用机制描述的文档,调整
分段长度和分段重叠长度后,观察不同分块之间上下文衔接的流畅性,确保关键术语和数据未被割裂。 - 上传包含常见标题和子标题分隔符的 Word 文档,检查
自定义分隔符是否有效将文档内容按预期逻辑切分为独立的分块。 - 通过随机抽取解析后的分块,与原始文档进行比对,确认解析内容无缺失、无乱码,且专业术语和单位(如 nM、µg/kg)保持正确。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。