这个品类的数据长什么样
小分子化药的数据主要来源于药物研发过程中的实验报告、临床试验数据、专利文献、药物说明书、以及药理毒理数据库(如 PubChem、ChEMBL、DrugBank)。这些数据更新频率相对较低,通常随研发进展或新药上市而更新。文档结构以非结构化文本(如研究论文、专利描述)和半结构化数据(如化合物结构式、理化性质表、药代动力学数据)为主。核心字段包括化合物编号、CAS 号、分子结构式(SMILES 或 InChI)、分子量、LogP 值、溶解度、生物活性数据(IC50、EC50)、靶点信息、作用机制、适应症、不良反应、剂量与用法等。单位涉及摩尔浓度(nM、μM)、毫克(mg)、毫升(mL)、时间(小时、天)等。
这些特征在「多轮对话与提示词」这一环带来什么约束
小分子化药数据特有的复杂结构和专业性对多轮对话与提示词提出了具体要求。非结构化文本多,需要更强的语义理解能力来抽取关键信息。专业术语和缩写的使用,要求模型具备领域知识。化合物结构式等特殊数据类型,需要特定的处理方式。更新频率低,意味着知识库构建时需要关注历史数据的一致性与准确性。多轮对话中,用户可能围绕某个化合物的多个属性或不同化合物之间的比较进行提问,这要求模型能维持上下文,并准确关联不同信息点。提示词设计需引导模型在检索和生成时,优先关注理化性质、作用机制、临床数据等核心字段,同时避免误解模糊的化学命名或非标准化表述。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾小分子化药文档中描述性文本的完整性与RAG检索效率。 |
召回条数 | 8–12 条 | 确保覆盖化合物多维度信息,同时控制上下文窗口大小。 |
相似度阈值 | 0.75–0.85 | 领域专业性高,需要较高相似度以确保检索结果的准确性。 |
重排返回条数 | 3–5 条 | 聚焦最相关的关键信息,减少无关干扰。 |
maxContext | 8000–12000 token | 支撑多轮对话中涉及的多个化合物属性和对比分析。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理包含大量实验数据或复杂结构描述的Word/PDF文件。 |
容易做错的三处
- 对话中出现化合物结构式描述错误或关键理化参数缺失:原因在于知识库中结构化信息抽取不准确或提示词未明确引导模型关注特定字段。
- 多轮对话后模型无法关联前序提及的化合物信息:原因在于
maxContext设置过低,导致上下文丢失,或提示词未有效强化实体识别与关联。 - 大文件解析耗时过长导致超时:原因在于
PARSE_FILE_TIMEOUT_SECONDS设置不足,未能适应大型实验报告或专利文档的处理需求。
怎么确认配好了
- 针对典型小分子化药(如阿司匹林、布洛芬),进行多轮对话测试,核对模型对理化性质、作用机制、适应症等回答的准确性和完整性。
- 上传多个包含化合物结构式和实验数据的大型PDF或Word文档,观察文档解析时间,确保在
PARSE_FILE_TIMEOUT_SECONDS内完成。 - 设计包含模糊化学命名或缩写的查询,检查模型是否能正确理解并关联到知识库中的标准信息,并通过调整
相似度阈值来优化。 - 测试不同化合物之间的比较性问题,验证模型是否能准确识别并对比关键属性,确保
maxContext足以支撑复杂的上下文。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。