基于R语言的自动数据收集:网络抓取和文本挖掘实用指南

基于R语言的自动数据收集:网络抓取和文本挖掘实用指南

作者
西蒙•蒙策尔特
出版社
机械工业出版社 版次:第1版
出品方
机械工业出版社
语言
简体中文
页数
366页
装帧
平装
ISBN
9787111527503
分类
自动化技术
重量
699 g
尺寸
25.6 x 18.4 x 1.2 cm
电子书格式
epub,pdf,txt,azw3,mobi,fb2,djvu
下载次数
1022
更新日期
2022-04-02

本书共17章。第1章是概述,阐述数据挖掘的意义与实际应用。第2~8章介绍网络和数据技术基础知识。这一部分内容涉及互联网上通信、交换、保存和显示信息的基础技术(如HTTP、HTML、XML、JSON、AJAX、SQL等),并讲解用于查询网络文档和数据集的基本技术(XPath和正则表达式)。第9~11章介绍网络抓取和文本挖掘的实用工具箱。这一部分由三个核心章节组成:第9章讲解多种网络抓取技术,涉及正则表达式的使用、XPath、各类API接口、其他数据类型以及开源社区相关的技术;第10章深入介绍用于统计性文本处理的技术;第11章给出关于用R管理数据的项目中常见问题的一些见解。第12~17章介绍实际案例分析,涉及美国参议院里的合作网络、从半结构化文档解析信息、利用Twitter预测2014年奥斯卡奖、绘制姓氏地理分布图、采集关于手机的数据、分析产品评论里的情绪等。这些案例分析针对日常的数据抓取和文本处理的工作流程、真实环境数据中的陷阱以及规避它们的方法等问题提供一些实用的见解。

基于R语言的自动数据收集:网络抓取和文本挖掘实用指南 EPUB, PDF, TXT, AZW3, MOBI, FB2, DjVu, Kindle电子书免费下载。

《基于R语言的自动数据收集:网络抓取和文本挖掘实用指南》电子书免费下载

epub下载 pdf下载 txt下载 azw3下载 mobi下载 fb2下载 djvu下载