这个品类的数据长什么样
中药投研数据主要来自《中国药典》系列、地方中药材炮制规范、药企内控质量标准、临床研究论文及行业标准文档。《中国药典》单篇条目包含性味归经、炮制方法、含量检测项等固定字段,单位涉及mg/g、℃、小时;药企内控文档包含批次信息与实时检测数据;临床研究论文为多章节结构,包含试验设计与统计结果。国家级药典每5年修订一次,企业内控数据按季度更新,临床研究数据随成果发布更新。
这些特征在「引用来源与溯源」这一环带来什么约束
中药数据的多来源层级(国家级药典、地方标准、企业内控)要求溯源需精准关联具体版本与批次,避免混淆不同权威层级的结论;长文档与多字段结构要求分段解析时保留上下文关联,防止断章取义;量化字段(如含量、炮制温度)的精确匹配需求,要求召回逻辑兼顾语义与数值特征;不同来源的更新节奏差异,要求定期同步最新版本的权威文档,确保引用内容的时效性。投研场景的结论追溯需求,还要求溯源信息包含具体章节、页码或段落位置。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 800–1200 字符 | 匹配单篇药典条目或临床研究段落的长度,避免截断关键信息 |
similarityThreshold | 0.75–0.85 | 针对中药量化字段的精确匹配需求,高于通用文本匹配阈值 |
recallTopK | 前6–8条 | 覆盖单味药多来源数据(药典、地方标准、企业数据)的召回需求 |
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 处理长文档(如多卷临床研究汇编)的解析耗时 |
enableSourceLink | 开启 | 关联文档的版本号、页码等元数据,符合投研溯源的精度要求 |
embeddingModel | text-embedding-3-large | 匹配中药复杂语义与量化字段的召回需求 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:问答返回结果中未显示源文档的版本号、页码等溯源信息,或引用源数据字段为空。原因:未开启
enableSourceLink配置,或上传知识库时未勾选「保留文档元数据」选项。 - 现象:服务启动后长时间无响应,调用时返回504超时错误。原因:未调整
PARSE_FILE_TIMEOUT_SECONDS参数,长文档解析耗时超过默认阈值。 - 现象:召回的知识库内容与输入问题不匹配,或无法输出用户上传的问答对原文。原因:
similarityThreshold设置过高或过低,或未将问答对的「答复」字段单独作为召回匹配项。
怎么确认配好了
- 上传单篇《中国药典》条目文档,检查解析后的元数据是否包含版本号、页码等字段。
- 发起测试提问,查看返回结果中是否附带可追溯的源文档链接或元数据信息。
- 调整
similarityThreshold参数,验证不同阈值下的召回结果匹配精度是否符合预期。 - 上传包含含量检测数据的文档,确认召回结果中是否保留了原始数值与单位。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。