博客主题词提取关键技术研究.docx

资料分类:设计作品 上传会员:紫色烟火 更新时间:2022-06-18
需要金币1000 个金币 资料包括:完整论文 下载论文
转换比率:金额 X 10=金币数量, 例100元=1000金币 论文字数:11228
折扣与优惠:团购最低可5折优惠 - 了解详情 论文格式:Word格式(*.doc)

摘要:在由博客所构成的博客空间中蕴含了大量的关于主题(或者兴趣)的信息。在这样的年代下,人们要想在网上真正找到一些自己十分想要了解的知识与信息等就会觉得无从下手。所以,数据挖掘就扮演者着不可或缺的重要角色。

本文研究的主要内容就是如何从博客文本数据中提取出关键词。首先获取源数据并进行预处理,也就是数据描述和文本处理。然后进行数据的特征选择并完成关键词抽取:

即使用TF-IDF分词技术选出候选词并基于这些候选词统计特征构造、使用LDA模型以及Word2vec模型和Doc2vec模型完成特征构造和基于XGBoost模型完成博客主题词生成。最终将算出得分最高的三个词汇作为最后提取出的关键词,用作代表博客有用信息的关键词。

关键词:关键词提取;TF-IDF;Word2vec;LDA;多特征

 

目录

摘要

Abstract

1  绪论-1

1.1  研究背景及意义-1

1.2  国内外相关研究概况及发展趋势-1

1.3  本文主要研究内容-2

2  数据处理及模型选择-4

2.1  数据预处理-4

2.1.1  数据描述-4

2.1.2  分词技术-4

2.2  机器学习理论-5

2.2.1  XGBoost算法优点-6

2.2.2  XGBoost算法目标函数-6

2.2.3  特征选择-7

2.3  本章小结-8

3  关键词抽取-9

3.1  问题描述-9

3.2  基于TF-IDF的候选词集合选择-9

3.3  基于候选词的统计特征构造-9

3.4  基于表示学习的特征构造-10

3.4.1  Word2vec-10

3.4.2  LDA-11

3.4.3  Doc2vec-11

3.5  基于XGBoost算法的预测模型-12

3.6  基于XGBoost模型的博客主题词生成-13

3.6.1  候选词及文档的特征表达-13

3.6.2  基于XGBoost算法模型的特征选择-13

3.6.3  实验结果与分析-14

3.7  本章小结-16

结    论-17

参 考 文 献-18

附    录-19

致    谢-30

相关论文资料:
最新评论
上传会员 紫色烟火 对本文的描述:如今面对海量信息时代,如何快速地从大量文本中挖掘出人们所需的真正信息,成为本文要解决的问题。所以本文研究的最重要的点就是处理自然语言,尤其对中文文本完成自然语言处......
发表评论 (我们特别支持正能量传递,您的参与就是我们最好的动力)
注册会员后发表精彩评论奖励积分,积分可以换金币,用于下载需要金币的原创资料。
您的昵称: 验证码: