这个品类的数据长什么样
小分子化药的注册申报资料数据主要来源于药品研发各阶段的实验报告、分析数据、临床试验结果以及法规文件。这些数据通常以结构化(如临床试验数据库、理化性质表)和非结构化(如研究报告、批生产记录、质量标准草案)的形式存在。数据更新频率在研发阶段较高,项目推进中可能每周甚至每日都有新数据生成,而法规文件和指南则相对稳定,每年进行修订或发布。文档结构复杂,包含大量专业术语、化学式、图表和参考文献。字段与单位具有高度专业性,例如药代动力学参数的 Cmax(单位 ng/mL)、Tmax(单位 h),药理毒理的 LD50(单位 mg/kg),以及质量标准中的 含量(单位 %)、杂质(单位 ppm)。
这些特征在「引用来源与溯源」这一环带来什么约束
小分子化药数据的高专业性和复杂性,要求引用来源必须精准到具体实验报告、批次号或文献页码,以确保申报资料的严谨性。频繁更新的研发数据意味着知识库需要高效的同步机制,避免引用过时信息。文档中包含的化学式、图表等非文本信息,对知识库的解析能力提出了挑战,纯文本的召回可能遗漏关键信息。专业字段和单位的准确识别与引用,是确保申报资料合规性的基础,任何单位或数值的错误引用都可能导致严重后果。因此,在生成申报资料时,必须确保引用的内容不仅语义正确,而且数值和单位无误,且能追溯到原始数据出处,以满足药监机构的严格要求。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunkSize | 800–1200 字符 | 平衡了文本语义完整性和召回效率,适应报告中常见段落长度 |
overlapSize | 100 字符 | 确保分段边界上下文连续,降低语义割裂风险 |
recallThreshold | 0.78–0.85 | 兼顾了召回的全面性和相关性,减少无关信息引入 |
maxContext | 6000 tokens | 适应申报资料中对上下文依赖度高的专业论述,确保模型能理解复杂逻辑 |
refSourceDisplayMode | 仅显示来源标题和页码 | 满足法规要求对引用出处的明确性,避免正文冗余 |
parseFileTimeout | 600 秒 | 应对大型PDF报告或扫描件的复杂解析时间,防止解析中断 |
容易做错的三处
- 生成的申报资料中出现类似
[引用标记: 1]的字样,原因在于模型输出时未正确处理引用格式,或渲染层没有配置隐藏引用标记。 - 某些关键数据点(如某个批次的杂质含量)未被引用或引用错误,现象是申报资料中数据缺失或与原始报告不符,原因在于知识库索引颗粒度不够细致,或召回策略未能准确命中。
- 模型输出内容与原始文献的单位不一致,例如
mg/kg误写为g/kg,原因在于知识库在摄取时未能正确识别和标注单位,或模型在生成时未严格遵循数据源的单位信息。
怎么确认配好了
- 选取多份不同类型的小分子化药原始报告(如临床试验报告、稳定性研究报告),通过 FastGPT 生成摘要或问答,检查输出内容中的专业术语、数值和单位是否与原始报告完全一致。
- 对生成的申报资料进行随机抽样检查,验证其中引用的所有数据点是否都能通过
refSourceDisplayMode指定的来源信息,准确追溯到原始文档的具体页码或章节。 - 上传包含化学结构式或复杂图表的PDF文档,测试知识库能否正确解析并支持相关问答,确认非文本信息的处理能力。
- 模拟更新频繁的研发数据情景,上传新版实验报告,验证知识库更新后,模型对最新数据的引用是否准确,同时不再引用旧版本数据。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。