这个品类的数据长什么样
临床前安评数据主要来源于药理毒理研究报告、GLP(良好实验室规范)实验室原始记录、专题报告、病理报告、毒代动力学报告以及相关批件与法规文件。这些文档通常以 PDF、Word 或扫描件形式存在。数据更新频率相对较低,主要集中在新药研发项目的关键节点,如 IND(新药临床试验申请)申报前。文档结构高度规范,遵循 ICH(国际人用药品注册技术协调会)指导原则和各国药监机构要求,包含固定的章节标题、数据表、图表和统计结果。字段方面,涉及剂量、给药途径、动物种属、观察指标(如体重、脏器系数、血液学、尿液学、病理学发现)、毒性反应类型、靶器官、MABEL/NOAEL 值等。单位严格遵循国际标准,如 mg/kg、g/kg、mmol/L、μm 等,且常伴随上下限、置信区间等统计学信息。
这些特征在「知识库检索与召回」这一环带来什么约束
临床前安评文档的规范结构与固定字段,使得对特定信息点的精确抽取成为可能,但同时也要求检索系统能识别并区分不同报告中的同名字段。例如,不同研究中的“剂量”字段,其背后可能对应不同的给药周期或动物模型。低更新频率意味着知识库构建初期需要一次性摄入大量历史数据,后续维护以增量更新为主,对实时性要求不高。文档中包含大量表格和图表,传统的文本分段方法可能割裂关键数据,导致检索结果不完整。严格的单位与统计学信息要求检索结果不仅要召回相关文本,还要能准确呈现数值与单位,避免混淆。此外,由于专业术语高度密集,且常见英文缩写,对多语言或专业术语的识别能力是确保检索准确性的关键。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500-800 字符 | 临床前安评文档段落结构规整,此长度能较好地保留单个实验结果或结论的完整性,避免关键信息被截断。 |
分段重叠长度 | 50-100 字符 | 适当重叠有助于捕捉跨段落的上下文关联,尤其在描述某个毒性反应的起始与后续观察时,保证检索的连贯性。 |
相似度阈值 | 0.75-0.85 | 安评领域对准确性要求高,过低的阈值可能召回大量不相关内容,而过高的阈值则可能遗漏语义相近但措辞略有不同的关键信息。 |
召回条数 | 8-12 条 | 考虑到安评报告的复杂性,适当增加召回条数可以覆盖更多潜在相关段落,为后续的大模型推理提供更全面的上下文,以应对部分问题需要综合多处信息的情况。 |
重排返回条数 | 3-5 条 | 经过初始召回后,利用重排模型进一步筛选出与查询最相关的核心信息,减少大模型处理冗余信息的负担,提升响应速度和准确性。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 临床前安评报告通常篇幅较长且包含复杂结构(如嵌套表格),文件解析需要较长时间,延长超时时间可避免因解析未完成而导致的文件上传失败。 |
容易做错的三处
- 模型仅输出中文,即便提示是英文且知识库内容也为英文,这通常是由于大模型本身对多语言支持不均衡,或在特定部署环境下默认以中文进行响应。
- 知识库检索结果与问题不匹配,可能源于分段策略不当,导致关键信息被分割,或语义嵌入模型未能有效捕捉专业术语的深层含义。
- 用户提问后未调用知识库,直接由大模型生成回答,这通常是由于查询与知识库内容的相关性得分过低,未达到触发知识库检索的
相似度阈值。
怎么确认配好了
- 上传具有代表性的临床前安评报告,检查文件解析日志,确认无
FILE_PARSE_FAILED错误,并且文档内容被正确切分并索引。 - 针对报告中的特定实验结果、毒性反应描述或关键数值,设计包含专业术语和缩写的查询,验证检索结果中是否包含精确的原文段落。
- 测试不同复杂度的查询,观察
召回条数和重排返回条数是否与预期相符,并通过人工评估召回内容与查询的相关性,调整相似度阈值。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。