小分子化药研发文档结构化解析的多轮对话与提示词

小分子化药研发文档主要涵盖化合物结构信息、合成路线、药代动力学(ADME)数据、药效学(PD)数据、毒理学报告、临床试验方案与结果、专利文件等。数据来源多样

这个品类的数据长什么样

小分子化药研发文档主要涵盖化合物结构信息、合成路线、药代动力学(ADME)数据、药效学(PD)数据、毒理学报告、临床试验方案与结果、专利文件等。数据来源多样,包括内部实验记录、CRO 报告、公开文献数据库(如 PubChem、ChEMBL)、专利数据库。更新频率较高,尤其在研发早期,化合物筛选、合成与初步活性测试数据每日更新。文档格式多样,包含 PDF、Word、Excel、图像(如谱图),其中 PDF 占据主导。字段与单位具有高度专业性,例如半数致死量(LD50)单位为 mg/kg,半衰期(t1/2)单位为小时,IC50 或 EC50 单位为 nM 或 μM,溶解度单位为 mg/mL。分子结构常以 SMILES 或 InChI 字符串表示。

这些特征在「多轮对话与提示词」这一环带来什么约束

小分子化药研发文档的专业性与多样性对多轮对话与提示词的设计提出了具体要求。首先,大量专业术语和缩写(如 SAR、ADME、PK/PD)要求提示词能够引导模型准确理解上下文,避免歧义。其次,文档中包含的结构式、图表等非文本信息,在结构化解析后需以恰当的文本形式呈现,以便模型在对话中引用。例如,SMILES 字符串的准确解析与引用至关重要。第三,数据更新频率高,要求知识库能够快速同步最新数据,提示词需引导模型优先引用最新信息。第四,字段与单位的严谨性,要求提示词明确指示模型在引用数值时必须带上正确的单位,例如在描述药物浓度时必须区分 nM 和 μM,避免因单位错误导致理解偏差。最后,文档结构复杂,多轮对话需能处理跨文档、跨章节的信息溯源和整合,提示词应引导模型进行逻辑推理和信息综合。

配置怎么定

配置项建议取法这样取的依据
maxContext2000 字符确保模型能容纳足够长的化合物描述、实验结果与上下文,同时控制计算成本。
分段长度400 字符适应研发报告中多为短句、紧凑的专业描述,提高召回精度。
召回条数7 条综合考虑小分子药物研发的复杂性与文档关联性,兼顾召回广度与计算效率。
相似度阈值0.78确保召回内容的专业性和相关性,排除语义相近但不准确的通用信息。
重排返回条数3 条聚焦最核心、最相关的几段信息,减少模型处理噪音,提升回答质量。
PARSE_FILE_TIMEOUT_SECONDS600 秒应对大型实验报告或专利文件解析,提供充足的处理时间。

容易做错的三处

  • 模型在引用化合物数据时,数值与单位出现错配或遗漏,通常是提示词未明确强调输出数值时带上单位。
  • 多轮对话过程中,模型对前几轮提到的化合物或实验条件产生混淆,这是因为maxContext设置过小,导致上下文截断。
  • 模型在回答中生成了与知识库内容不符的分子结构描述,往往是知识库解析时未能正确提取 SMILES 字符串,或提示词未要求模型直接引用原文。

怎么确认配好了

  • 进行多轮对话测试,提问关于特定化合物的药代动力学数据,检查模型回答中的数值是否带有正确单位,如 mg/kg、小时。
  • 模拟用户提问同一化合物在不同实验条件下的活性数据,观察模型是否能准确区分并引用相应数据,并验证上下文保持能力。
  • 查询复杂分子结构的合成路线或专利信息,核对模型输出的 SMILES 字符串与原始文档是否完全一致。
  • 上传一份包含多种图表和表格的实验报告,检查知识库解析后,模型在对话中能否准确提取并描述图表中的关键数据点。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。