半导体投研知识库建设的多轮对话与提示词

半导体投研所需的数据来源包括公开行业研报、晶圆代工厂公开财报、半导体专利数据库、器件测试报告、EDA设计输出文档。更新节奏存在差异:行业研报按周或月度更新,

这个品类的数据长什么样

半导体投研所需的数据来源包括公开行业研报、晶圆代工厂公开财报、半导体专利数据库、器件测试报告、EDA设计输出文档。更新节奏存在差异:行业研报按周或月度更新,财报按季度更新,专利随申请节点实时更新,量产测试报告随生产节点更新。文档结构多样:研报包含制程节点、良率、营收占比等结构化字段,测试报告包含测试环境、参数单位为纳米(nm)、功率(W)、晶圆直径(英寸)等标准化字段,部分EDA输出文档为结构化JSON或CSV格式,部分为几十页的长文本深度报告。

这些特征在「多轮对话与提示词」这一环带来什么约束

半导体数据的多源属性、时效差异、单位特定性与结构差异,对多轮对话与提示词配置带来多重约束。首先,多轮对话需明确标注不同数据源的更新时间,避免使用过期参数影响投研判断。其次,需内置单位校验与转换逻辑,统一纳米(nm)、瓦特(W)等单位的使用,防止参数混淆导致的投研误差。第三,需适配不同长度的文档,长深度研报需分段召回以保证信息完整,短测试报告需精准匹配字段以提升提取效率。第四,需区分结构化财报数据与非结构化专利文本的处理方式,在多轮对话中分别执行参数提取、跨厂商对比等逻辑。

配置怎么定

配置项建议取法这样取的依据
maxContext10000–15000 字符适配半导体行业研报、测试报告的平均长度,避免多轮对话上下文溢出
parse_file_chunk_size800–1200 字符平衡参数提取精准度与召回效率,适配半导体文档的结构化参数分布
recall_top_k前8条覆盖主流半导体厂商的核心制程、良率等参数,满足投研对比需求
similarity_threshold0.75–0.85适配半导体参数的精准度要求,避免引入无关测试数据或遗漏相关文档
rag_reference_format[文档来源] 字段:参数值(单位)清晰展示半导体参数的来源、字段与单位,便于投研人员核对
workflow_hide_output开启隐藏AI对话中间输出,仅保留经文本拼接组件处理后的统一回复

本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。

容易做错的三处

  • 现象:对话日志的标注功能仅覆盖文本片段,未关联半导体参数的具体字段与单位。原因:未在预设提示词中明确要求标注参数对应的文档字段、单位及来源,导致标注无法支撑投研人员的核对需求。
  • 现象:工作流中AI对话的中间输出直接展示在页面,未经过文本拼接组件统一输出。原因:未开启workflow_hide_output配置,或未在工作流中配置输出触发规则,导致中间步骤的AI内容暴露。
  • 现象:多轮对话中第二个AI节点无法读取第一个节点的输出参数。原因:未在工作流中配置变量传递逻辑,未将第一个对话的输出结果绑定为第二个对话的输入上下文,导致参数无法跨节点传递。

怎么确认配好了

  • 上传一篇半导体测试报告与行业研报,触发多轮对话,核对上下文窗口是否覆盖全部核心参数,无溢出截断。
  • 发起包含跨厂商参数对比的多轮对话,核对AI输出是否标注了参数的单位、来源与更新时间。
  • 配置工作流隐藏输出后,验证页面仅展示经文本拼接组件处理后的统一回复,无中间步骤的AI输出。
  • 触发知识库检索与AI对话流程,核对AI引用的检索结果是否包含完整的字段、参数值与单位信息。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。