北京日报
必要时,可以将向量评分与传统的BM25关键词得分进行融合,通过加权或学习的方式获得最终排名
三、误区二:使用不当的向量化模型或参数 不同语义向量模型(如Word2Vec、BERT及其变体)的训练数据、维度和侧重点各异
建议使用正则表达式或相应的提取工具,过滤掉HTML标签、脚本内容以及页面中的固定版块
同时,对正文进行分💎词、去停🔑用词和规范化处理
但实际中,直接使用原始向量距离💪排序,往往返回大量内容相近但实💡际意图不同的页面
解决复盘 :选择模型时,应优先考虑提供中文预训练且经过SEO场景微调的版本
很多优化者仅仅在初期评估一🚀次召回率,后续便不再监控
常见的问题是直接将原始网页内容(包含大量噪声🔑如广告代码、无关链接、重复段落)输入向量模型
五、误区四:缺乏持续更新与评估机制 语义向量索引一旦🤔搭建完毕,若不随网站内容更新而迭代,其效果会逐渐劣化