半导体投研知识库建设的上下文与 token

半导体投研数据主要来自晶圆厂工艺规范文档、EDA设计输出文件、行业协会供需报告、券商细分研报。更新节奏差异明显:工艺类文档更新周期为季度至年度,行业供需数据

这个品类的数据长什么样

半导体投研数据主要来自晶圆厂工艺规范文档、EDA设计输出文件、行业协会供需报告、券商细分研报。更新节奏差异明显:工艺类文档更新周期为季度至年度,行业供需数据按月度更新,研报随行业事件不定期发布。文档结构包含长文本技术说明、结构化参数表格、半结构化供需统计项,字段多为制程节点、单批次产能、时序参数、电压阈值等,单位涵盖纳米、片/月、纳秒、伏特等。

这些特征在「上下文与 token」这一环带来什么约束

长文本工艺文档单份token占用量较高,易超出模型预设上下文窗口上限,导致文档截断或召回失败;结构化参数表格的多列字段若未合理拆分,会造成token冗余或跨字段上下文关联断裂;不同更新节奏的数据需匹配对应召回优先级,避免陈旧数据占用过多token配额;高精度制程、时序参数需保留完整数值精度,截断会影响投研分析的准确性。

配置怎么定

配置项建议取法这样取的依据
chunkSize1000–1500 字符适配半导体文档的长文本与结构化表格,平衡单块token占用与上下文关联度
recallTopK前3–5条半导体投研需关联多维度参数,过多召回会超出token配额
similarityThreshold0.72–0.85半导体参数精度要求高,阈值过低会引入无关数据,过高会遗漏有效参数
maxTokenPerChunk800–1200 token避免单块token超出模型限制,同时保留参数完整性
contextWindow32000–64000 token适配长文本工艺文档与多召回块的token占用
overlapSize100–200 字符维持跨分段的参数上下文关联,避免结构化表格拆分后字段断裂

本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。

容易做错的三处

  • 现象:上传包含10000+行的半导体产能Excel文件后,系统提示token消耗超出配额,或分段结果中出现字段缺失。原因:未调整chunkSize参数,默认分段长度未适配结构化表格的列数与行数,导致单块token占用过高。
  • 现象:调用半导体工艺参数召回接口时,返回Reached the max retries per request limit错误。原因:高精度参数的匹配请求参数冗余,超出接口重试配额。
  • 现象:上传长文本EDA设计文档时,系统提示上下文窗口溢出,或文档被强制截断。原因:contextWindow参数设置过小,未适配长文本的token占用量。

怎么确认配好了

  • 上传单份典型半导体工艺文档,查看系统生成的分段详情,确认每块的长度与token占用符合配置。
  • 发起一次模拟投研查询,核对召回结果的条数与匹配精度符合预设规则。
  • 查看系统的token使用日志,确认单次对话的消耗符合预期配置。
  • 上传多类半导体文档(如表格、长文本、研报),验证分段与召回的关联逻辑正常。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。