这个品类的数据长什么样
生物等效性临床试验预筛的数据主要来源于已上市药物的药代动力学(PK)数据、体外溶出度数据、以及相关的药学研究报告、临床试验报告和监管机构发布的指导原则。这些数据通常以结构化表格、PDF 文档、Word 文档等形式存在。更新频率相对较低,主要随新药上市、指导原则修订或大型研究发布而变化。文档中核心字段包括药物名称、活性成分、剂型、给药途径、PK 参数(如 AUC、Cmax、Tmax)、溶出曲线、BE 试验结果(R/T 比值、置信区间)、受试者特征、生物样本分析方法等。单位涉及浓度(ng/mL)、时间(h)、剂量(mg)、体积(L)等。
这些特征在「工具调用与插件」这一环带来什么约束
生物等效性数据的多样性与专业性对工具调用提出了高要求。PK 参数、溶出曲线等结构化数据需要精确解析,PDF 报告中的非结构化文本需通过 OCR 和信息抽取技术转化为可处理的格式。由于数据更新不频繁,知识库的实时性压力较小,但准确性至关重要。BE 试验结果的 R/T 比值和置信区间是关键判断依据,需要在工具调用中进行精确计算或比对。此外,对受试者特征、分析方法等文本描述的理解,需要利用 AI Agent 的语义理解能力,结合外部专业工具进行辅助判断,例如调用药物相互作用查询工具或药代动力学模型模拟工具。对这些专业字段和单位的识别与转换,是确保工具调用结果准确性的前提。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | PDF 报告中段落较长,保证语义完整性;兼顾模型输入限制 |
相似度阈值 | 0.75 | 确保召回的药学、PK 参数等专业信息相关性高,降低误判 |
重排返回条数 | 前 5 条 | 精准筛选出最相关的少数关键信息,减少无关干扰 |
maxContext | 16000 tokens | 应对复杂 BE 试验报告,提供足够上下文进行综合分析 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型 PDF 或包含复杂表格的文档,避免解析超时 |
API_KEY | 按实际使用的外部药学数据库或模型服务提供 | 外部工具调用凭证,确保数据访问权限与服务正常使用 |
容易做错的三处
- 工具调用返回空值或错误代码,原因是外部药学数据库的 API 请求参数格式不正确或缺少必要的认证信息。
- 预筛结果出现显著偏差,原因是对文档中 PK 参数的单位识别错误,导致数值计算或比对逻辑出错。
- 处理大型临床报告时出现解析超时,原因是没有调整
PARSE_FILE_TIMEOUT_SECONDS,默认值不足以处理复杂文档。
怎么确认配好了
- 针对不同剂型和给药途径的已知药物,执行预筛流程,比对 AI Agent 给出的 BE 试验判断与实际监管批文结果的一致性。
- 随机抽取多份包含 PK 参数、溶出曲线数据的 PDF 文档,检查知识库中提取出的关键字段值是否与原文完全匹配。
- 模拟外部药学数据库或药代动力学模型工具的调用,检查请求参数、返回结果格式是否符合预期,并确认关键字段的正确解析。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。