凤凰网
常见做法包括: 使用爬虫工具抓取TOP 10-20页面的正文内容; 对中文文本进行分词(推荐使用jieba分词)、去除停用词(如“的”“是”“在”等无实际意义的高频词); 保留名词、动词、形容词等实词,必要时进行词性标注
TF-IDF帮助识别页面中哪些关键词具有更高的区分度,而LDA则⭐揭示文章所涵盖的潜在主题分布
第二步:计算TF-IDF值,提取高区分度关键词 统计词频(TF) :计算每个词在目标文档中出现的次数,通常做归一化处理,即TF = 某📌个词在文档中出现的次数 / 文档总词数
计算逆文档频率(IDF) :IDF = log(语料库总⚡文档数 / 包含该词的文档数 + 1)