这个品类的数据长什么样
半导体投研所需的数据来源包括公开行业研报、晶圆代工厂公开财报、半导体专利数据库、器件测试报告、EDA设计输出文档。更新节奏存在差异:行业研报按周或月度更新,财报按季度更新,专利随申请节点实时更新,量产测试报告随生产节点更新。文档结构多样:研报包含制程节点、良率、营收占比等结构化字段,测试报告包含测试环境、参数单位为纳米(nm)、功率(W)、晶圆直径(英寸)等标准化字段,部分EDA输出文档为结构化JSON或CSV格式,部分为几十页的长文本深度报告。
这些特征在「多轮对话与提示词」这一环带来什么约束
半导体数据的多源属性、时效差异、单位特定性与结构差异,对多轮对话与提示词配置带来多重约束。首先,多轮对话需明确标注不同数据源的更新时间,避免使用过期参数影响投研判断。其次,需内置单位校验与转换逻辑,统一纳米(nm)、瓦特(W)等单位的使用,防止参数混淆导致的投研误差。第三,需适配不同长度的文档,长深度研报需分段召回以保证信息完整,短测试报告需精准匹配字段以提升提取效率。第四,需区分结构化财报数据与非结构化专利文本的处理方式,在多轮对话中分别执行参数提取、跨厂商对比等逻辑。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 10000–15000 字符 | 适配半导体行业研报、测试报告的平均长度,避免多轮对话上下文溢出 |
parse_file_chunk_size | 800–1200 字符 | 平衡参数提取精准度与召回效率,适配半导体文档的结构化参数分布 |
recall_top_k | 前8条 | 覆盖主流半导体厂商的核心制程、良率等参数,满足投研对比需求 |
similarity_threshold | 0.75–0.85 | 适配半导体参数的精准度要求,避免引入无关测试数据或遗漏相关文档 |
rag_reference_format | [文档来源] 字段:参数值(单位) | 清晰展示半导体参数的来源、字段与单位,便于投研人员核对 |
workflow_hide_output | 开启 | 隐藏AI对话中间输出,仅保留经文本拼接组件处理后的统一回复 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:对话日志的标注功能仅覆盖文本片段,未关联半导体参数的具体字段与单位。原因:未在预设提示词中明确要求标注参数对应的文档字段、单位及来源,导致标注无法支撑投研人员的核对需求。
- 现象:工作流中AI对话的中间输出直接展示在页面,未经过文本拼接组件统一输出。原因:未开启
workflow_hide_output配置,或未在工作流中配置输出触发规则,导致中间步骤的AI内容暴露。 - 现象:多轮对话中第二个AI节点无法读取第一个节点的输出参数。原因:未在工作流中配置变量传递逻辑,未将第一个对话的输出结果绑定为第二个对话的输入上下文,导致参数无法跨节点传递。
怎么确认配好了
- 上传一篇半导体测试报告与行业研报,触发多轮对话,核对上下文窗口是否覆盖全部核心参数,无溢出截断。
- 发起包含跨厂商参数对比的多轮对话,核对AI输出是否标注了参数的单位、来源与更新时间。
- 配置工作流隐藏输出后,验证页面仅展示经文本拼接组件处理后的统一回复,无中间步骤的AI输出。
- 触发知识库检索与AI对话流程,核对AI引用的检索结果是否包含完整的字段、参数值与单位信息。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。