这个品类的数据长什么样
小分子化药的临床试验预筛数据主要来源于化合物结构数据库、体内外药效实验数据、毒理学报告、临床前研究报告以及已发表的科学文献。这些数据通常以结构化数据库条目、非结构化文本报告和半结构化表格的形式存在。化合物结构数据(如 SMILES 字符串、InChIKey)更新相对稳定,而临床试验进展和药效数据可能随着实验阶段推进而频繁更新。文档结构多样,包括 PDF 格式的实验报告、Word 文档的方案设计、Excel 表格的实验结果。字段涵盖化合物 ID、靶点、作用机制、IC50/EC50 值、PK/PD 参数、不良反应事件等,单位常见有 nM、µM、mg/kg、h 等,需要精确解析。
这些特征在「引用来源与溯源」这一环带来什么约束
小分子化药数据源的多样性对引用来源的统一管理提出了要求。化合物结构式和药效参数等精确数值的引用,要求系统能够准确识别并关联到原始数据点,确保溯源的准确性。临床前报告中大量的非结构化文本,如毒理学描述、药代动力学分析,需要高效的文本解析能力来提取关键信息并建立引用链接。由于数据更新频率不一,引用溯源机制必须能够处理版本控制,确保引用指向的是特定时间点的数据版本。同时,不同数据源的字段和单位差异,例如 IC50 值可能存在不同单位,要求引用系统能够进行标准化或提供明确的单位标注,避免信息混淆。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 2000 字符 | 确保临床试验报告中的关键段落完整性,同时控制上下文长度以提高检索效率 |
分段长度 | 500 字符 | 兼顾结构化数据条目和非结构化文本的切分,避免语义中断 |
召回条数 | 10 条 | 覆盖多个潜在相关的数据源和报告片段,提高初期召回的广度 |
相似度阈值 | 0.78 | 平衡召回精度与召回率,减少不相关结果的干扰,特别是针对数值和专业术语的匹配 |
重排返回条数 | 3 条 | 精炼最终呈现的引用,优先展示最相关、信息密度最高的临床试验数据或报告摘要 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型临床试验报告(如 PDF 文档)的解析时间,避免因超时导致文件处理失败 |
容易做错的三处
- 引用显示“未找到来源”,实际知识库中存在相关数据,原因在于知识库分段策略不当,导致关键信息被截断或语义边界模糊。
- 工作流API调用返回的引用数据为空,但知识库中已配置全局变量,原因在于API调用时
knowledge_base_id参数未正确传递或未与工作流中的知识库关联。 - 答案与知识库专业内容不符,即使显示引用了知识库,原因在于
相似度阈值设置过低或重排返回条数过少,导致模型从非核心引用中提取信息或重要的引用未被充分利用。
怎么确认配好了
- 针对典型的小分子化药查询,检查返回答案中引用的
source字段是否包含具体的文档名称、页码或数据源标识符。 - 随机选取一个引用来源,核对其内容是否与原始临床前报告或化合物数据库中的对应信息完全一致,包括数值和单位。
- 模拟更新某个化合物的药效数据,观察系统在查询时是否能引用到最新版本的数据,并能追溯到更新前的版本。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。