这个品类的数据长什么样
半导体投研数据主要来自晶圆厂工艺规范文档、EDA设计输出文件、行业协会供需报告、券商细分研报。更新节奏差异明显:工艺类文档更新周期为季度至年度,行业供需数据按月度更新,研报随行业事件不定期发布。文档结构包含长文本技术说明、结构化参数表格、半结构化供需统计项,字段多为制程节点、单批次产能、时序参数、电压阈值等,单位涵盖纳米、片/月、纳秒、伏特等。
这些特征在「上下文与 token」这一环带来什么约束
长文本工艺文档单份token占用量较高,易超出模型预设上下文窗口上限,导致文档截断或召回失败;结构化参数表格的多列字段若未合理拆分,会造成token冗余或跨字段上下文关联断裂;不同更新节奏的数据需匹配对应召回优先级,避免陈旧数据占用过多token配额;高精度制程、时序参数需保留完整数值精度,截断会影响投研分析的准确性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunkSize | 1000–1500 字符 | 适配半导体文档的长文本与结构化表格,平衡单块token占用与上下文关联度 |
recallTopK | 前3–5条 | 半导体投研需关联多维度参数,过多召回会超出token配额 |
similarityThreshold | 0.72–0.85 | 半导体参数精度要求高,阈值过低会引入无关数据,过高会遗漏有效参数 |
maxTokenPerChunk | 800–1200 token | 避免单块token超出模型限制,同时保留参数完整性 |
contextWindow | 32000–64000 token | 适配长文本工艺文档与多召回块的token占用 |
overlapSize | 100–200 字符 | 维持跨分段的参数上下文关联,避免结构化表格拆分后字段断裂 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:上传包含10000+行的半导体产能Excel文件后,系统提示token消耗超出配额,或分段结果中出现字段缺失。原因:未调整
chunkSize参数,默认分段长度未适配结构化表格的列数与行数,导致单块token占用过高。 - 现象:调用半导体工艺参数召回接口时,返回
Reached the max retries per request limit错误。原因:高精度参数的匹配请求参数冗余,超出接口重试配额。 - 现象:上传长文本EDA设计文档时,系统提示上下文窗口溢出,或文档被强制截断。原因:
contextWindow参数设置过小,未适配长文本的token占用量。
怎么确认配好了
- 上传单份典型半导体工艺文档,查看系统生成的分段详情,确认每块的长度与token占用符合配置。
- 发起一次模拟投研查询,核对召回结果的条数与匹配精度符合预设规则。
- 查看系统的token使用日志,确认单次对话的消耗符合预期配置。
- 上传多类半导体文档(如表格、长文本、研报),验证分段与召回的关联逻辑正常。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。