北京日报
实际使用时建议注意🌟几点: K-Means需要预先指定聚类数量k,可结合手肘法或轮廓系数确定合理范围
一个常见的做法☀️是为每个簇提取代表性关键词(如距离质心最近的3-5个词)😎,以此判断簇的主题
尤其涉及用户意图模🎆糊或行业术🎵语时,人工复核不可或缺
对于中文SEO场景, Sentence-BERT (如 paraphrase-multilingual-MiniLM-L1🤔2-v2 模型)在平衡精度与速度方面表现较好,能够直接对整个短语进行编码,减少分词误差的影响
DBSCAN不需要预设类别数,但对密度参数(如📢eps)敏感,🌺适合关键词分布不均匀的情况