这个品类的数据长什么样
注册申报涉及的数据来源多样,包括药学研究、临床试验、非临床研究报告等,通常以 PDF、Word、Excel 等多种格式呈现。这些文档更新频率相对较低,主要在研发阶段性成果提交和审评反馈时进行修订。文档结构高度规范,遵循 ICH 指导原则和各国药监机构的特定要求,例如 CTD(通用技术文件)格式。字段包括药物名称、活性成分、制剂工艺、稳定性数据、药代动力学参数、毒理学数据、临床试验方案、疗效终点等。单位严格统一,如 mg/kg、mol/L、℃、小时、天,对精度要求极高。
这些特征在「上下文与 token」这一环带来什么约束
注册申报文档的规范化结构和低更新频率,使得分段策略可以更聚焦于语义完整性和章节边界,避免因频繁更新导致知识库失效。高精度要求的数值字段和严格的单位体系,要求在上下文构建时必须保留完整的数值和单位信息,不能截断或模糊,这直接影响 token 消耗。文档篇幅普遍较长,单份文件可能包含数十万甚至上百万字符,对模型最大上下文长度提出了较高要求。同时,多个相关文档之间存在复杂引用关系,需要将关联文档片段纳入上下文,以确保模型理解的全面性和准确性,避免因信息缺失导致错误解析。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
最大上下文 token | 16000 token | 适应注册申报文档的平均篇幅和信息密度 |
知识库最大引用 | 3000 token | 确保关键信息片段的完整性,覆盖复杂语义关联 |
最大响应 token | 2000 token | 满足结构化提取和摘要输出的长度需求 |
分段长度 | 800–1200 字符 | 兼顾语义完整性与 token 效率 |
召回条数 | 8 条 | 覆盖多个相关章节,支持跨文档信息整合 |
相似度阈值 | 0.75 | 确保召回内容的精准性,减少无关信息干扰 |
容易做错的三处
- 解析结果中出现数值或单位缺失:原因在于分段时截断了关键的数值-单位对,或
最大上下文 token不足导致模型无法完整理解。 - 模型输出内容与预期不符,或出现“我无法提供该信息”:原因在于
知识库最大引用过小,未能将足够多的关联上下文提供给模型。 - API 调用返回超时错误:原因可能是
最大响应 token设置过大,导致模型生成时间过长,超出接口限制。
怎么确认配好了
- 随机抽取 5 份典型注册申报文档,验证其关键数值和单位是否能被准确提取,并通过人工比对确认。
- 针对包含复杂引用关系的文档,测试模型能否正确关联不同章节或文件中的信息,检查
召回条数和相似度阈值对结果的影响。 - 模拟高并发场景,观察 API 接口的响应时间,确保在
最大响应 token和最大上下文 token的配置下,系统稳定性符合预期。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。