新华社
常见做法包括🔍以下步骤: 收集查询样本 :从百度搜索下拉、相关搜索、以及后台关键词报告中提取3000~⭐5000条用户真实查询
句式结构特征 :包含“哪里”“哪个”“推荐”通常属于考察型;而纯粹的实体词如“百度”可能是导航型
特征提取 :提取查询中的有效特征,比如词性、句式(是否包含疑问词“怎么”“如何”“是什么”)、长度、是否包含品牌词或价格词等
在规则基础上,可以结🌟合 TF-IDF向量化 或 Word2Vec词嵌入 ,将查询转化为数值特征,然后使用逻辑回归或随机森林等传统机器学习算法训练分类器
一般建议控制在5~8个基础类别内,超过20个类别的模型🎆往往难以维护🎯且容易过拟合
建模前的准备工作:数据清洗与标注 从零开🔍始搭建搜索意图识别模型,首先需要建立一份高质量的标注数据集
零基础学习者可以重点关注以下三个指标: 指标 作用 参考阈值(基础阶段) 准确率 预测正🍀确的样本占总样本的比例 ≥0
构建简单的规则模型与特征工程 对于零基础学习者,不必一开始就📚追求复杂的深度学习模型
实际搜索中,用户往往在一个查询里混合了多种意图,例如“2026年SEO新规下载与学习”——😎既有信息需求(学习),又有下载操作需求
需要特别注意的是,在🔥建模过程中,意图标签的粒度不宜过细
清洗噪声数据 :去除明显无意义或无结果的查询(如乱码、过长且无结构的语句),以保证模型不会因低质数据而偏离正确方向
层次化建模 :先识别一级意图(如信息型),再进一步细分二级意图(如教程型⭐、🎵定义型、比较型)
模型评估与持续迭代 ⭐初步建成的模📢型需要通过评估才能知道是否可用
人工标注意图 :根据搜索结果的实际情🌅🌟况,为每条查询标注意图类别
这一阶段的重点是理解“特征如何影响分类结果”,而非追求极致的准确率
70 F1分数 准确率😎与召回率的调和均值 ≥0