基因治疗 AAV注册申报资料准备的多轮对话与提示词

基因治疗AAV(腺相关病毒)的注册申报资料,核心数据来源于临床前研究报告、CMC(化学制造与控制)文件、非临床研究报告和临床试验数据。这些资料通常以PDF、

这个品类的数据长什么样

基因治疗 AAV(腺相关病毒)的注册申报资料,核心数据来源于临床前研究报告、CMC(化学制造与控制)文件、非临床研究报告和临床试验数据。这些资料通常以 PDF、DOCX、XLSX 等格式存在,结构复杂,包含大量专业术语、图表和表格。例如,CMC 部分会详细记录病毒载体的生产工艺、质量控制、批次分析等;临床前报告则涵盖药效学、毒理学研究数据。数据更新频率相对较低,主要集中在研发阶段性成果汇报、临床试验数据提交以及监管机构反馈后的补充修订。文档篇幅普遍较长,单个文件可能达数百页。字段与单位具有高度专业性,如病毒滴度(vg/mL)、纯度(%)、基因组完整性(%)、宿主细胞残留 DNA(ng/mg)等,这些都需要精确识别与解析。

这些特征在「多轮对话与提示词」这一环带来什么约束

基因治疗 AAV 注册申报资料的复杂性与专业性,对多轮对话与提示词设计提出了严格约束。长篇幅文档和专业术语要求模型具备强大的上下文理解能力,以避免在多轮交互中丢失关键信息或产生语义漂移。例如,在询问特定批次载体的质量属性时,模型需能追溯到前面对话中提及的批次号,并从相应 CMC 报告中提取精确数据。低更新频率意味着知识库的构建需要一次性尽可能全面,并注重版本管理。文档结构复杂,包含大量图表和表格,使得纯文本抽取可能不足以满足需求,需要结合图像识别或表格解析能力,这会影响提示词中对数据格式的预期。此外,精确的字段与单位要求提示词必须引导模型进行严谨的数值提取和单位匹配,避免出现数值正确但单位错误的问题,这在申报资料中是关键的合规性要求。

配置怎么定

配置项建议取法这样取的依据
maxContext20000 字符确保在多轮对话中能够覆盖长篇幅申报资料的上下文,避免关键信息丢失。
分段长度800 字符平衡了文本段的完整性与模型处理效率,减少单一分段内的信息密度过高导致理解偏差。
召回条数15 条考虑到专业术语和复杂关联,增加召回条数有助于覆盖更全面的相关信息。
相似度阈值0.78提高阈值以确保召回结果与 AAV 申报资料的高度专业化查询意图更匹配。
重排返回条数8 条在较高召回条数的基础上,通过重排提升最相关内容的优先级,聚焦核心信息。
temperature0.3降低模型生成回复的随机性,确保回复内容基于申报资料事实,严谨且可追溯。

容易做错的三处

  • 模型在多轮对话中对特定数值或单位的提取出现偏差,例如将“1.2E13 vg/mL”误识别为“1.2E13”或遗漏单位。这是由于提示词未能明确引导模型关注并验证数值与单位的完整性。
  • 用户提问涉及图表或表格中的数据时,模型无法给出正确答案,或回复“未找到相关信息”。这通常是由于知识库构建时,未能有效解析图表或表格内容,导致这些非文本信息未被模型索引。
  • 在连续追问某个专业术语的定义或关联信息时,模型回复内容逐渐偏离主题或出现前后矛盾。这表明 maxContext 设置不足以维持长程依赖,或提示词中缺乏对上下文一致性的强调。

怎么确认配好了

  • 进行多轮对话测试,模拟申报资料审核人员的提问路径,核对模型对关键参数、法规要求、实验结论等专业内容的回答是否准确无误,并与原始文档进行比对,验证数据来源。
  • 针对包含表格和图表的文档进行提问,确认模型能够正确提取并解释这些非结构化数据中的信息,验证知识库对复杂数据类型的处理能力。
  • 在连续追问特定批次或研究阶段的详细信息时,检查模型是否能保持上下文一致性,并准确引用之前对话中提及的关键标识符(如批次号、试验编号),判断 maxContext 配置是否合理。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。