这个品类的数据长什么样
DTP 药房在注册申报资料准备过程中,涉及的数据主要来源于药品生产企业提供的原始文件、药监部门发布的政策法规、以及药房自身运营产生的合规记录。原始文件包括药品说明书、注册批件、检验报告、临床试验数据等,多为 PDF、Word、或扫描件形式。政策法规则以 PDF 或政府网站页面为主,更新频率较高,需要密切关注。药房内部合规记录则包含资质证明、人员培训记录、质量管理体系文件等,通常以内部文档管理系统或电子表格形式存储。数据更新节奏受药品上市、政策调整、以及药房内部管理周期影响,部分核心文件如药品批件相对稳定,但法规条款、补充申请资料等则可能按季度或年度更新。文档结构差异大,既有标准化的表格数据,也有非结构化的文本描述和图表。字段与单位方面,药品批件涉及通用名称、商品名、剂型、规格、注册证号等,检验报告包含含量、纯度、有效期等,需注意不同药品和检测方法的单位差异。
这些特征在「向量模型与索引」这一环带来什么约束
DTP 药房注册申报资料的异构数据源和多样的文档格式,对向量模型的文件解析能力提出了要求,特别是对于扫描件 PDF 的文字识别准确性。法规文件更新频繁,意味着索引需要支持高效的增量更新机制,以确保检索结果的时效性。药品说明书和临床试验报告中包含大量专业术语和复杂医学表述,需要向量模型具备较强的语义理解能力,避免因词汇不匹配而导致的召回失败。此外,不同文件中关于同一药品或法规条款的描述可能存在细微差异,需要索引能够识别并整合这些信息。药品批件中结构化数据与非结构化文本的混杂,要求向量模型能够同时处理结构化字段的精确匹配与非结构化文本的语义检索。对于字段与单位的特殊性,需要确保向量化过程能保留数值信息,并在检索时支持单位换算或范围查询。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | 应对大型药品说明书或检验报告文件 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 确保复杂 PDF 或扫描件的文字识别和解析完成 |
分段长度 | 800–1200 字符 | 平衡上下文完整性与向量模型处理效率 |
召回条数 | 前 10 条 | 覆盖更多潜在相关文档片段,提高检索准确性 |
相似度阈值 | 按实测标定 | 需根据具体数据和检索需求,在精度与召回率间取舍 |
重排返回条数 | 前 5 条 | 精炼最终结果,减少人工筛选成本 |
容易做错的三处
- 知识库卡在索引创建的最后阶段,通常是由于某个文件解析超时或包含无法处理的特殊字符。
- 新添加的 Embedding 模型在索引成功后,进行搜索测试时报错,可能是因为 Embedding 模型与 FastGPT 版本不兼容,或模型服务未能正确响应。
- 知识库未能正确向量化图片中的文字内容,导致相关检索结果缺失,原因在于未启用 OCR 能力或 OCR 引擎识别准确率不足。
怎么确认配好了
- 上传典型药品说明书和法规文件,检查知识库文档状态,确认所有文件均显示为“已完成索引”。
- 使用药品通用名、注册证号、以及法规条款编号进行检索,验证返回结果中是否包含相关批件和法规原文,并检查返回结果条数。
- 针对药品不良反应、禁忌等专业医学词汇进行查询,评估召回片段是否精准且上下文完整,并核对
相似度阈值的合理性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。