这个品类的数据长什么样
中药投研数据来源包括国家药典委员会发布的法定标准、各省市中药炮制规范、公开的中药成分检测数据库、临床循证文献、产地溯源质检报告。更新节奏上,法定标准每5年左右集中修订,日常有补充公告;成分数据随检测技术更新不定期发布;临床文献随研究进展持续新增。单条数据文档包含通用名、拉丁名、性味归经、功能主治、用法用量、化学成分、炮制方法、注意事项等字段,部分文档附带高清图谱、批次检测数据。字段单位方面,用量多以克、毫升为单位,成分含量以mg/g、%为单位,产地数据包含经纬度坐标。
这些特征在「数据库与运维」这一环带来什么约束
多字段且嵌套的文档结构,要求数据库支持灵活的字段扩展与全文检索。成分数据的高精度数值与批次信息,需要支持精确的数值查询与时间戳版本管理。法定标准的定期更新,要求运维流程支持批量数据替换与版本回溯。临床文献的非结构化片段,需要预处理后统一存入向量库,同时关联原始文献元数据。高频更新的成分数据,要求数据库配置读写分离以降低并发压力。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_FILE_TIMEOUT_SECONDS | 1200 秒 | 单份中药文档可能包含多段图谱解析与长文本字段,需延长解析超时时间 |
UPLOAD_FILE_MAX_SIZE | 2000 MB | 支持上传批次检测报告的高清扫描件与成分数据表格 |
vectorStore.batchSize | 50 | 中药文档的字段数量多,批量插入向量库时需控制单批次条目数避免超时 |
召回条数 | 前15条 | 需覆盖性味归经、功能主治、成分等多维度检索需求,增加召回基数 |
相似度阈值 | 0.75 | 区分相似中药的精准字段,避免低匹配度的无关结果混入 |
db.versionRetentionCount | 10 | 保留法定标准的历史版本,支持合规回溯与修订对比 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:导出的dataset.csv仅包含index字段,无content字段。原因:未开启向量库的原始文本存储配置,仅同步了索引元数据。
- 现象:高并发场景下请求成功率偏低。原因:未配置数据库读写分离,且向量库批量插入阈值设置过高,导致连接池耗尽。
- 现象:仅抓取到部分数据库表格数据。原因:未配置表格字段的白名单过滤,系统跳过了非结构化的备注字段,或数据库连接超时时间过短未完成全量拉取。
怎么确认配好了
- 上传包含多字段的中药标准文档,查看解析后的数据库条目是否包含所有预设字段。
- 发起批量检索请求,查看系统监控面板的连接占用率与请求成功率。
- 导出知识库的dataset.csv,检查文件中是否同时存在index与content字段。
- 配置分享链接参数,验证生成的链接是否携带数据库标识id。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。