siRNA 核酸药注册申报资料准备的引用来源与溯源

siRNA核酸药的注册申报资料涉及多种数据类型,核心包括临床前研究数据(体外、体内药效学、药代动力学、毒理学报告)、临床试验数据(I、II、III期临床研究

这个品类的数据长什么样

siRNA 核酸药的注册申报资料涉及多种数据类型,核心包括临床前研究数据(体外、体内药效学、药代动力学、毒理学报告)、临床试验数据(I、II、III 期临床研究方案、伦理批件、受试者知情同意书、CRF 表、统计分析报告)以及生产工艺与质量控制文件(CMC 文件,如生产批记录、质量标准、稳定性研究报告)。数据来源广泛,包括研究机构内部报告、CRO 公司提交的报告、监管机构发布的指导原则和法规文件。更新频率相对较低,主要集中在研发阶段的关键节点和监管政策调整时。文档结构复杂,多为 PDF、Word 格式的非结构化文本,包含大量专业术语、图表和表格数据。字段与单位具有高度专业性,例如药代动力学参数(Cmax、AUC、t1/2)、毒理学指标(LD50、NOAEL)以及核酸序列信息等。

这些特征在「引用来源与溯源」这一环带来什么约束

siRNA 核酸药数据来源的专业性和多样性,要求引用来源与溯源机制能够准确识别不同类型文档的出处。文档的非结构化特性意味着需要强大的文本解析能力,以从复杂报告中抽取出关键事实和数据点。数据更新频率较低,但一旦更新往往具有全局性影响,因此系统需确保引用来源的时效性,并能追溯到特定版本。专业字段和单位的广泛使用,对 RAG 检索的语义理解能力提出了更高要求,避免因术语歧义导致溯源错误。同时,涉及大量图表和表格数据,纯文本检索可能不足以满足需求,需要对这些非文本信息进行有效索引和关联。最终,监管机构对申报资料的严谨性要求,使得引用来源的精确性和可验证性成为核心约束。

配置怎么定

配置项建议取法这样取的依据
分段长度500–800 字符确保单个分段能包含完整专业概念或实验结果描述,同时避免过长导致信息冗余。
召回条数前 8–12 条考虑到 siRNA 资料的专业密度和关联性,增加召回量有助于捕获更多相关上下文。
相似度阈值0.78–0.85针对高专业性文本,适当提高阈值以确保检索结果的精确相关性。
重排返回条数前 5 条在召回基础上,通过重排进一步提升最相关信息的排名,聚焦核心证据。
PARSE_FILE_TIMEOUT_SECONDS600 秒处理大型临床报告和 CMC 文件时,预留充足的文件解析时间。
知识库ID返回启用确保每次对话都能明确返回引用的具体知识库 ID,便于追溯和验证。

容易做错的三处

  1. 回答中出现专业术语的错误解释或引用数据与原文不符。原因在于分段粒度过大或语义理解不足,导致模型在生成时误解上下文。
  2. 无法定位到特定报告中的某个图表或表格数据。原因在于文件预处理时未能有效提取和索引非文本信息,导致 RAG 检索盲区。
  3. 引用来源显示为“未知”或指向无关文档。原因在于知识库索引更新不及时,或者检索参数设置过于宽松,未能精准匹配原始出处。

怎么确认配好了

  1. 针对若干关键的临床前和临床数据点,验证模型生成内容是否能准确引用到原始报告的具体章节或段落。
  2. 随机抽取申报资料中的复杂图表或表格,检查模型是否能识别并关联到相关文本描述或数据来源。
  3. 模拟对过时法规或指导原则的查询,验证系统是否能识别并提示相关信息的版本更新情况。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。