这个品类的数据长什么样
siRNA 核酸药的注册申报资料涉及多种数据类型,核心包括临床前研究数据(体外、体内药效学、药代动力学、毒理学报告)、临床试验数据(I、II、III 期临床研究方案、伦理批件、受试者知情同意书、CRF 表、统计分析报告)以及生产工艺与质量控制文件(CMC 文件,如生产批记录、质量标准、稳定性研究报告)。数据来源广泛,包括研究机构内部报告、CRO 公司提交的报告、监管机构发布的指导原则和法规文件。更新频率相对较低,主要集中在研发阶段的关键节点和监管政策调整时。文档结构复杂,多为 PDF、Word 格式的非结构化文本,包含大量专业术语、图表和表格数据。字段与单位具有高度专业性,例如药代动力学参数(Cmax、AUC、t1/2)、毒理学指标(LD50、NOAEL)以及核酸序列信息等。
这些特征在「引用来源与溯源」这一环带来什么约束
siRNA 核酸药数据来源的专业性和多样性,要求引用来源与溯源机制能够准确识别不同类型文档的出处。文档的非结构化特性意味着需要强大的文本解析能力,以从复杂报告中抽取出关键事实和数据点。数据更新频率较低,但一旦更新往往具有全局性影响,因此系统需确保引用来源的时效性,并能追溯到特定版本。专业字段和单位的广泛使用,对 RAG 检索的语义理解能力提出了更高要求,避免因术语歧义导致溯源错误。同时,涉及大量图表和表格数据,纯文本检索可能不足以满足需求,需要对这些非文本信息进行有效索引和关联。最终,监管机构对申报资料的严谨性要求,使得引用来源的精确性和可验证性成为核心约束。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 确保单个分段能包含完整专业概念或实验结果描述,同时避免过长导致信息冗余。 |
召回条数 | 前 8–12 条 | 考虑到 siRNA 资料的专业密度和关联性,增加召回量有助于捕获更多相关上下文。 |
相似度阈值 | 0.78–0.85 | 针对高专业性文本,适当提高阈值以确保检索结果的精确相关性。 |
重排返回条数 | 前 5 条 | 在召回基础上,通过重排进一步提升最相关信息的排名,聚焦核心证据。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型临床报告和 CMC 文件时,预留充足的文件解析时间。 |
知识库ID返回 | 启用 | 确保每次对话都能明确返回引用的具体知识库 ID,便于追溯和验证。 |
容易做错的三处
- 回答中出现专业术语的错误解释或引用数据与原文不符。原因在于分段粒度过大或语义理解不足,导致模型在生成时误解上下文。
- 无法定位到特定报告中的某个图表或表格数据。原因在于文件预处理时未能有效提取和索引非文本信息,导致 RAG 检索盲区。
- 引用来源显示为“未知”或指向无关文档。原因在于知识库索引更新不及时,或者检索参数设置过于宽松,未能精准匹配原始出处。
怎么确认配好了
- 针对若干关键的临床前和临床数据点,验证模型生成内容是否能准确引用到原始报告的具体章节或段落。
- 随机抽取申报资料中的复杂图表或表格,检查模型是否能识别并关联到相关文本描述或数据来源。
- 模拟对过时法规或指导原则的查询,验证系统是否能识别并提示相关信息的版本更新情况。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。