这个品类的数据长什么样
小分子化药的注册申报资料数据主要来源于药品研发各阶段的实验报告、分析数据、临床试验结果、生产工艺记录、质量标准及稳定性研究等。这些数据通常以结构化(如临床试验数据库、理化性质表)和非结构化(如研究报告、批生产记录PDF、CTD文档)两种形式存在。数据更新频率在研发早期可能较为频繁,但在申报后期主要围绕补正和审评反馈进行。文档结构遵循ICH CTD(通用技术文档)格式,包括模块1到模块5,其中涉及大量的专业术语、化学结构式、图表、单位(如 mg/kg、nM、℃、pH)和缩写。
这些特征在「多轮对话与提示词」这一环带来什么约束
小分子化药资料的专业性和CTD结构对多轮对话的准确性和上下文管理提出高要求。对话系统需要准确识别化学名称、剂量单位和专业术语,例如 IC50 或 AUC。非结构化文档的复杂性要求RAG系统具备强大的信息抽取能力,以从长篇报告中精准定位关键数据点。多轮对话中,用户可能会追问某个特定化合物的药代动力学参数或毒性数据,这要求系统能将前一轮对话中提及的实体作为后续查询的上下文。此外,对历史对话的依赖性高,需要系统能够追溯并整合多个回合的信息,以生成完整且无矛盾的申报内容片段。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 8 | 确保上下文覆盖多轮追问,避免信息丢失,支持复杂问题分解。 |
分段长度 | 500-800 字符 | 兼顾语义完整性和索引效率,适应长篇报告中的段落结构。 |
召回条数 | 10-15 条 | 增加相关文档片段的召回几率,应对专业术语和交叉引用。 |
相似度阈值 | 0.75 | 保证召回内容的专业相关性,避免引入无关的化学或生物学信息。 |
重排返回条数 | 5 条 | 精选最相关的文档片段,优化给大语言模型的输入质量,减少噪声。 |
responseTimeout | 600 秒 | 预留充足时间处理复杂查询和RAG操作,特别是针对大型PDF文档。 |
容易做错的三处
- 现象:AI生成的申报内容出现剂量单位混淆或化学结构描述错误。原因:提示词未能明确限定特定单位格式或缺乏对化学实体识别的强化。
- 现象:多轮对话中,AI无法正确关联前一轮提到的特定化合物名称,导致后续回答脱节。原因:上下文窗口
maxContext设置过小,或实体识别模型对专业名词的泛化能力不足。 - 现象:系统在处理长篇PDF报告时,频繁出现
TimeoutException或内容截断。原因:responseTimeout参数设置不足,或文档预处理阶段未有效优化大文件的分块和向量化策略。
怎么确认配好了
- 选取包含复杂化学结构和剂量单位的真实申报资料,通过多轮对话模拟用户提问,检查AI回复的准确性与专业术语的一致性。
- 设计包含指代词(如“该化合物”、“其数据”)的连贯性问题序列,观察AI是否能正确维护上下文,将前一轮的实体信息代入后续回答。
- 上传多个不同长度和结构的CTD文档,测试系统在不同文档类型下的信息抽取和问答表现,并通过日志检查
responseTimeout是否被触发,评估响应时间。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。