这个品类的数据长什么样
眼科注册申报资料的数据来源多样,涵盖临床试验报告、非临床研究报告、生产工艺文件、质量标准、说明书等。这些资料通常以 PDF、Word、Excel 等多种格式存在,其中包含大量的专业术语、图片、表格和图表。临床试验报告可能包含数十至数百页,涉及病例数据、统计分析结果、不良事件记录等,更新频率较低,主要在申报阶段提交。非临床研究报告侧重动物实验数据和药理毒理学信息。眼科特有的数据包括眼底照片、OCT 图像、视野检查报告、视力表数据等,这些往往以图片或嵌入式对象形式存在,并伴随详细的文字描述与测量单位(如 mm Hg、logMAR、D)。文档结构上,通常遵循 ICH 或国家药监局(NMPA)的 CTD 格式,层级分明,但内部内容组织可能因研发机构而异。
这些特征在「文档解析与分块」这一环带来什么约束
眼科申报资料中大量的图片和嵌入式对象,对文档解析能力提出了高要求,纯文本提取可能丢失关键信息。长篇幅的临床试验报告,需要细致的分块策略,避免单块信息过载或割裂关键上下文。专业术语和缩写(如 IOP、AMD、DR)密集,要求解析器能正确识别并维持其在上下文中的完整性。此外,不同文档类型(如临床报告与质量标准)的结构差异大,需要灵活的分块规则。文档中常出现的表格数据,例如药物成分列表、不良反应统计,需要确保表格结构在分块后仍能被正确识别和关联,否则可能导致数据无法被有效检索或理解。计量单位的准确识别和保留也至关重要,例如眼压(mmHg)或视力(logMAR),丢失单位会影响数据解读的准确性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 平衡上下文完整性与检索效率,适应临床试验报告中段落长度 |
分段重叠长度 | 100–150 字符 | 确保分块边界的上下文连续性,避免关键信息被截断 |
文件解析超时时间 | 600 秒 | 处理大型 PDF 或 Word 文档,尤其包含大量图片和表格时,防止解析中断 |
OCR 启用 | 是 | 识别嵌入的眼底照片、OCT 图像中的文字说明及扫描版文件内容 |
表格解析模式 | 智能解析 | 准确识别并提取复杂的临床数据表格,保持行列结构 |
图片描述提取 | 是 | 自动生成图片内容描述,弥补纯文本解析的不足,例如眼底图像的关键特征 |
容易做错的三处
- 上传大型 PDF 后,搜索测试无结果或报错,原因为
文件解析超时时间过短,未能完成对复杂文档的解析。 - 模型输出答案时未包含图片信息,现象是输出文本中缺少对图表的引用,原因为
OCR 启用或图片描述提取未开启,导致图片内容未被索引。 - 知识库中的表格数据检索不准确,表现为查询相关数据时返回的信息不完整或错误,原因为
表格解析模式设置不当,未能正确识别表格结构。
怎么确认配好了
- 上传典型的眼科临床试验报告 PDF,在知识库搜索测试中检索报告中的关键图片描述或表格内容,确认能够召回相关分块。
- 选择包含大量专业术语和缩写的文档进行解析,检查分块内容是否保持了术语的完整性,没有被不合理地切分。
- 上传一个包含复杂表格的 Excel 文件,通过搜索测试验证表格内部数据的检索准确性,例如特定药物剂量或不良事件发生率。
- 导入眼科说明书,确认其中关于剂量、用法、不良反应等关键信息的分块完整且易于检索。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。