这个品类的数据长什么样
市场准入研发文档通常包含复杂的法律法规条文、临床试验数据报告、药学研究报告、安全性评估报告以及经济学评估数据。这些文档来源多样,包括各国药品监管机构的官方指南、药企内部的研发报告、CRO(合同研究组织)提供的临床数据文件等。文档格式以 PDF、Word、Excel 为主,其中 PDF 占比最高。更新频率受政策法规调整和新药研发进展影响,通常为季度或年度更新。文档结构高度规范化,例如 ICH(国际人用药品注册技术协调会)指南有明确的模块划分。字段与单位具有高度专业性,涉及药代动力学参数(如 Cmax、AUC,单位 ng/mL * h)、临床有效性指标(如 ORR、PFS,单位 月)、统计学显著性(如 p-value)等。
这些特征在「模型接入与配置」这一环带来什么约束
市场准入文档的复杂性和专业性,对模型接入与配置提出了特定要求。首先,大量 PDF 格式且包含表格和图表的文档,需要强大的 文件解析器 支持,确保内容完整提取,尤其是表格数据的结构化。其次,专业术语和缩写(如 NDA、BLA、MAA)密集,要求模型具备较高的领域知识理解能力,避免语义误解。更新频率虽然不高,但政策变动可能导致局部关键信息发生质变,因此 知识库更新策略 需要支持增量更新和版本管理。字段与单位的严谨性,意味着模型在提取信息时必须精确识别数字和单位的关联,例如不能将 mg 误读为 g。此外,由于信息敏感性,数据安全和访问控制在 模型渠道配置 中也需严格考量,确保合规性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 2000–3000 tokens | 市场准入文档段落长,确保模型能理解上下文 |
分段长度 | 800–1200 字符 | 保留足够上下文,同时避免过长导致模型处理效率低 |
召回条数 | 10–15 条 | 保证关键信息的覆盖率,应对多源信息交叉验证需求 |
相似度阈值 | 0.75–0.85 | 领域专业性高,需要高相似度匹配以确保准确性 |
重排返回条数 | 前 5 条 | 提升召回结果的精准度,聚焦最相关的几条信息 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 大型 PDF 文档解析耗时较长,避免解析超时 |
容易做错的三处
- 对话中显示
404 status code且无响应体,通常是模型渠道配置中API 地址填写有误,导致 FastGPT 无法连接到指定的模型服务。 - 配置了本地部署的 Ollama 模型,但 FastGPT 无法连接,原因多为
Ollama 服务监听地址未设置为0.0.0.0,导致 Docker 容器内的 FastGPT 无法通过宿主机 IP访问。 - 在
模型渠道中无法选择预期的语言模型类型,仅显示重排模型,这通常是因为模型渠道的模型类型配置错误,或者FastGPT部署时未正确加载所有可用的模型接口插件。
怎么确认配好了
- 通过 FastGPT 的
模型测试功能,选择配置好的模型渠道,输入一个包含市场准入专业词汇的查询,观察模型是否能给出相关且准确的回复。 - 上传一份典型的市场准入 PDF 文档,检查
知识库中文档是否成功解析,并能正确识别出文档中的表格和关键字段,例如药物名称、适应症、法规编号。 - 针对知识库中的文档内容,进行
语义搜索,观察召回结果的相似度分数是否符合预期,并检查重排后的结果是否更精准地聚焦于查询意图。 - 检查
FastGPT 日志,确认没有出现与模型渠道或文件解析相关的ERROR或WARN级别错误信息,特别是http status code为2xx的正常通信记录。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。