| 需要金币: |
资料包括:完整论文 | ![]() | |
| 转换比率:金额 X 10=金币数量, 例100元=1000金币 | 论文字数:11228 | ||
| 折扣与优惠:团购最低可5折优惠 - 了解详情 | 论文格式:Word格式(*.doc) |
摘要:在由博客所构成的博客空间中蕴含了大量的关于主题(或者兴趣)的信息。在这样的年代下,人们要想在网上真正找到一些自己十分想要了解的知识与信息等就会觉得无从下手。所以,数据挖掘就扮演者着不可或缺的重要角色。 本文研究的主要内容就是如何从博客文本数据中提取出关键词。首先获取源数据并进行预处理,也就是数据描述和文本处理。然后进行数据的特征选择并完成关键词抽取: 即使用TF-IDF分词技术选出候选词并基于这些候选词统计特征构造、使用LDA模型以及Word2vec模型和Doc2vec模型完成特征构造和基于XGBoost模型完成博客主题词生成。最终将算出得分最高的三个词汇作为最后提取出的关键词,用作代表博客有用信息的关键词。 关键词:关键词提取;TF-IDF;Word2vec;LDA;多特征
目录 摘要 Abstract 1 绪论-1 1.1 研究背景及意义-1 1.2 国内外相关研究概况及发展趋势-1 1.3 本文主要研究内容-2 2 数据处理及模型选择-4 2.1 数据预处理-4 2.1.1 数据描述-4 2.1.2 分词技术-4 2.2 机器学习理论-5 2.2.1 XGBoost算法优点-6 2.2.2 XGBoost算法目标函数-6 2.2.3 特征选择-7 2.3 本章小结-8 3 关键词抽取-9 3.1 问题描述-9 3.2 基于TF-IDF的候选词集合选择-9 3.3 基于候选词的统计特征构造-9 3.4 基于表示学习的特征构造-10 3.4.1 Word2vec-10 3.4.2 LDA-11 3.4.3 Doc2vec-11 3.5 基于XGBoost算法的预测模型-12 3.6 基于XGBoost模型的博客主题词生成-13 3.6.1 候选词及文档的特征表达-13 3.6.2 基于XGBoost算法模型的特征选择-13 3.6.3 实验结果与分析-14 3.7 本章小结-16 结 论-17 参 考 文 献-18 附 录-19 致 谢-30 |

