中药投研知识库建设的引用来源与溯源

中药投研数据主要来自《中国药典》系列、地方中药材炮制规范、药企内控质量标准、临床研究论文及行业标准文档。《中国药典》单篇条目包含性味归经、炮制方法、含量检测

这个品类的数据长什么样

中药投研数据主要来自《中国药典》系列、地方中药材炮制规范、药企内控质量标准、临床研究论文及行业标准文档。《中国药典》单篇条目包含性味归经、炮制方法、含量检测项等固定字段,单位涉及mg/g、℃、小时;药企内控文档包含批次信息与实时检测数据;临床研究论文为多章节结构,包含试验设计与统计结果。国家级药典每5年修订一次,企业内控数据按季度更新,临床研究数据随成果发布更新。

这些特征在「引用来源与溯源」这一环带来什么约束

中药数据的多来源层级(国家级药典、地方标准、企业内控)要求溯源需精准关联具体版本与批次,避免混淆不同权威层级的结论;长文档与多字段结构要求分段解析时保留上下文关联,防止断章取义;量化字段(如含量、炮制温度)的精确匹配需求,要求召回逻辑兼顾语义与数值特征;不同来源的更新节奏差异,要求定期同步最新版本的权威文档,确保引用内容的时效性。投研场景的结论追溯需求,还要求溯源信息包含具体章节、页码或段落位置。

配置怎么定

配置项建议取法这样取的依据
maxContext800–1200 字符匹配单篇药典条目或临床研究段落的长度,避免截断关键信息
similarityThreshold0.75–0.85针对中药量化字段的精确匹配需求,高于通用文本匹配阈值
recallTopK前6–8条覆盖单味药多来源数据(药典、地方标准、企业数据)的召回需求
PARSE_FILE_TIMEOUT_SECONDS300 秒处理长文档(如多卷临床研究汇编)的解析耗时
enableSourceLink开启关联文档的版本号、页码等元数据,符合投研溯源的精度要求
embeddingModeltext-embedding-3-large匹配中药复杂语义与量化字段的召回需求

本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。

容易做错的三处

  • 现象:问答返回结果中未显示源文档的版本号、页码等溯源信息,或引用源数据字段为空。原因:未开启enableSourceLink配置,或上传知识库时未勾选「保留文档元数据」选项。
  • 现象:服务启动后长时间无响应,调用时返回504超时错误。原因:未调整PARSE_FILE_TIMEOUT_SECONDS参数,长文档解析耗时超过默认阈值。
  • 现象:召回的知识库内容与输入问题不匹配,或无法输出用户上传的问答对原文。原因:similarityThreshold设置过高或过低,或未将问答对的「答复」字段单独作为召回匹配项。

怎么确认配好了

  • 上传单篇《中国药典》条目文档,检查解析后的元数据是否包含版本号、页码等字段。
  • 发起测试提问,查看返回结果中是否附带可追溯的源文档链接或元数据信息。
  • 调整similarityThreshold参数,验证不同阈值下的召回结果匹配精度是否符合预期。
  • 上传包含含量检测数据的文档,确认召回结果中是否保留了原始数值与单位。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。