这个品类的数据长什么样
苗头化合物筛选的数据主要来源于药物靶点研究报告、高通量筛选结果、体外药效学数据、毒理学评估报告以及相关专利文献。这些文档通常以 PDF、Word、Excel 等格式存在,PDF 格式在其中占据主导地位,包含大量表格、图谱和化学结构式。数据更新频率相对较低,主要集中在新靶点发现、新化合物合成或评估结果发布时。文档结构复杂,往往包含摘要、引言、材料与方法、结果、讨论等多个章节。关键字段包括化合物结构、IC50/EC50 值、溶解度、生物利用度、靶点亲和力、ADMET 属性等,单位涉及微摩尔 (µM)、纳摩尔 (nM)、毫克/公斤 (mg/kg) 等多种,且常伴有 +/- 误差范围。
这些特征在「文档解析与分块」这一环带来什么约束
PDF 文档中的复杂表格和嵌入式图片对传统文本提取工具构成挑战,可能导致数据丢失或错位。长篇幅的研究报告和专利文献要求解析器能够有效识别章节结构,避免上下文中断。化合物结构式作为核心信息,其图像化特性使得直接文本解析难以获取,需要专门的图像识别或化学信息学工具辅助。单位和误差范围的存在,要求分块时能保持这些数值与对应字段的关联性,避免语义破碎。由于数据更新频率不高,知识库构建时需注重一次性高质量解析,降低后期维护成本。字段多样性和单位复杂性,使得单一的通用分块策略难以满足需求,需要针对性地设计分块规则,确保关键信息的完整性和可检索性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 确保每个分块包含足够上下文,覆盖完整的实验结果描述或化合物属性列表。 |
分段重叠长度 | 100–200 字符 | 维持上下文连续性,尤其在表格、列表或关键结论跨越分块边界时,避免信息割裂。 |
启用标题分段 | 启用 | 识别文档的章节和子章节标题,将相关内容组织到一起,保持逻辑完整性。 |
解析表格 | 启用 | 苗头化合物数据常以表格形式呈现,启用此功能可准确提取表格内数据,避免多行合并。 |
自定义分隔符 | 针对 Excel 文件设置为 \n (换行符) | Excel 源数据常一行一条记录,使用换行符作为分隔符可确保每条记录独立分块,避免多个记录合并至一个分块。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型 PDF 或包含复杂结构(如大量图片、表格)的文档时,提供充足的解析时间,避免因超时导致解析失败。 |
容易做错的三处
- 文档解析后,部分表格数据出现多行合并到一个分块中,导致信息混淆。原因是没有正确识别表格结构或未针对 Excel 源文件设置合适的自定义分隔符。
- 上传大型 PDF 文件后,系统长时间无响应或报告解析失败。原因可能是
PARSE_FILE_TIMEOUT_SECONDS配置过低,未能为复杂文档提供足够的处理时间。 - 召回结果中关键的化合物结构信息缺失,或者与数值型数据(如 IC50)分离。原因是在分块时未能有效处理图像内容,或分段策略导致数值与对应化合物描述分离。
怎么确认配好了
- 上传典型文档(如含复杂表格的 PDF、多行 Excel)后,检查知识库中分块的数量和内容,确保每个分块都包含完整且逻辑连贯的信息,特别是关键的化合物属性和实验数据。
- 针对知识库中不同分块,使用特定查询词(如化合物名称、靶点名称、IC50 值)进行检索,验证召回结果的准确性和完整性,确保相关信息能够被有效检索。
- 通过 FastGPT 的调试界面,查看文档解析日志,确认没有出现
Timeout或Parsing Error等异常,尤其是针对之前解析失败的文档。 - 对具有特定格式(如自定义分隔符)的文档,通过知识库的预览功能检查分块边界,确保自定义分隔符发挥作用,避免出现多条记录合并在一个分块的情况。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。