这个品类的数据长什么样
双特异性抗体药物在药物警戒领域的数据主要来源于临床试验报告、真实世界研究(RWE)数据、病例报告、药物不良反应报告(ADR)以及上市后监管文件。这些文档通常以 PDF、DOCX 或纯文本格式存在。更新频率方面,临床试验报告和上市后研究报告可能每年更新一次或在重要研究节点发布,而ADR报告则可能持续不断地产生。文档结构复杂,常包含图表、表格、复杂的医学术语和缩写。字段方面,常见的有患者基本信息、用药史、不良反应事件描述、严重程度、结局、相关性评估、药物剂量、给药途径等。单位则涉及剂量(如 mg/kg)、时间(如天、周)、实验室指标(如 μg/L、mmol/L)等,并且可能存在不同文档来源的单位不一致情况。
这些特征在「文档解析与分块」这一环带来什么约束
双特异性抗体药物警戒数据的复杂性对文档解析与分块提出了特定要求。其一,文档中包含的大量医学术语和缩写,要求解析器能正确识别并处理,避免因词汇理解偏差导致分块错误。其二,临床报告和ADR报告中常出现的嵌套表格和图表,使得传统基于文本的解析方法难以准确提取结构化信息,需要更智能的表格识别和内容关联能力。其三,不良反应事件的描述往往分散在不同段落甚至不同页码,这要求分块时能进行语义关联,确保单个不良反应事件的完整上下文被包含在一个块中。此外,不同来源文档单位不一致的问题,需要解析后进行标准化处理,以保证后续检索和生成结果的准确性。这些约束决定了分块策略必须兼顾语义完整性与信息密度。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunk_overlap_ratio | 0.1 | 确保相邻块之间有少量上下文重叠,以维持语义连贯性,同时避免冗余。 |
chunk_size | 800–1200 字符 | 兼顾不良反应事件描述的完整性和单个块的信息密度,避免过大或过小的块。 |
parser_mode | SEMANTIC_SPLITTER | 优先采用语义分割,以更好地识别和保留不良反应事件的上下文。 |
table_parsing_enabled | true | 确保能够从临床试验报告中准确提取不良反应相关的表格数据。 |
image_ocr_enabled | true | 识别图片中的文本信息,如部分报告中以图片形式呈现的图表或文字。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型临床研究报告或多页ADR汇总报告时,为解析过程预留足够时间。 |
容易做错的三处
- 上下文引用中,文档内容未按预期渲染为 Markdown 格式,这通常是由于解析器在处理特定字符或结构时未能正确转换,导致原始内容丢失或格式错误。
- 上传文档后,系统提示“解析失败”或“文档内容为空”,原因可能是
PARSE_FILE_TIMEOUT_SECONDS设置过低,导致解析大型或复杂文档时超时,未能完成内容提取。 - 知识库中切分块的展示不连贯或语义中断,这可能源于
chunk_size设置过小,导致一个完整的不良反应事件描述被拆分成多个不相关的块。
怎么确认配好了
- 上传一份包含复杂表格和多页文本的双特异性抗体临床报告,检查解析后的知识块是否完整包含表格数据和其上下文。
- 选择多个不同来源(如临床报告、ADR报告)的文档进行解析,核对解析结果中不良反应事件的描述是否语义完整且无明显截断。
- 通过知识库的预览功能,验证解析后的知识块是否保留了原始文档的关键医学术语和缩写,并且格式可读。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。