- 资源介绍
- 更新记录
- 安装教程
摘 要
时代在发展,技术在进步,互联网改变了全世界,各行各业都在这个互联网时代寻求自身的增长点,人们的日常生活也越来越离不开互联网。以租房为例,线下租房行业持续遭到冲击,越来越多的年轻人选择在互联网上挑选房源。然而网上信息混杂,数据来源众多,如何提升租房用户体验就成了一个值得探讨的问题。本文以此为研究方向,设计并实现了一个基于python开源爬虫框架scrapy的租房信息爬取系统,爬取互联网上多个含有此数据的网站。以城市为区分,将多个站点的数据存入非结构化数据库,再以数据库为连接,开发出一个以python开源web框架Django的基础的租房数据展示系统。与此同时,对爬取到的租房数据进行可视化处理。
关键词:scrapy;Django;非结构化数据库;数据可视化
ABSTRACT
The era is developing, technology is progressing, the Internet has changed the whole world. All walks of life are seeking their own growth points in this Internet age, and people’s daily life is becoming more and more inseparable from the Internet.Taking renting as an example, the rental industry has been under constant impact, and more and more young people have chosen to choose housing on the Internet. However, online information is mixed and data sources are numerous. How to improve the user experience of renting has become a problem worth discussing. As a research direction, this paper designs and implements a renting information crawling system based on Python open source crawler framework scrapy, and crawls several web sites on the Internet. With the city as the distinction, the data of multiple sites are stored in the unstructured database, and then the database is used as the connection to develop a renting data display system based on the python open source web framework Django. At the same time, we can visualize the data of rental housing.
Keywords: scrapy;Django;NoSQL DB;Data visualization
目 录
摘 要 I
ABSTRACT II
1 绪论 1
1.1 研究背景及需求分析 1
1.2 国内外研究现状 2
1.2.1 爬虫技术概述 2
1.2.2 爬虫设计者面临的问题与反爬虫技术现状 4
1.3 研究目标及研究内容 6
1.4 论文的整体结构 7
1.5 本章小结 7
2 相关理论及技术 8
2.1 robot协议对本设计的影响 8
2.2 爬虫 8
2.2.1 工作原理 8
2.2.2 工作流程 8
2.2.3 抓取策略 9
2.3 python发展现状 9
2.5 scrapy架构 10
2.5.1 scrapy:开源爬虫架构 10
2.6 MongoDB数据库 13
2.6.1 NoSQL数据库介绍 13
2.6.2 MongoDB数据库介绍 13
2.7 python web框架Django 14
2.7.1 Django框架介绍 14
2.7.2 MTV模式 14
2.7.3 ORM模式 14
2.7.4 template模板语言 14
2.7.5 Django工作机制 15
2.8 semantic UI开发框架 15
2.8.1 semantic介绍 15
2.8.2 semantic开发 16
2.9 高德地图API 16
2.10 本章小结 16
3 系统分析与设计 17
3.1 系统分析 17
3.1.1 系统功能 17
3.1.2 爬取对象分析 17
3.1.3 模块设计 18
3.2 数据流 19
3.3 系统总体逻辑层次 20
3.4 本章小结 21
4 爬虫与数据存储、展示的具体实现 22
4.1 爬虫模块 22
4.1.1 环境搭建与前期分析 22
4.1.2 爬虫规则预处理模块 23
4.1.3 数据抓取模块 24
4.1.4 数据存储模块 29
4.1.5 反反爬虫模块 30
4.2 数据库设计 34
4.2.1 数据库环境搭建 34
4.2.2 数据库表设计 35
4.3 数据展示模块 35
4.3.1 django环境搭建 35
4.3.2 前端UI模块 37
4.3.3 网页架构搭建模块 39
4.3.4 前端与数据库连接模块 41
4.3.5 地图展示模块 42
4.4 开启Django服务器 43
4.5 成果展示 43
4.6 本章小结 45
5 系统测试 46
5.1 测试环境及工具 46
5.2 系统功能性测试 46
5.2.1 数据爬取功能测试 46
5.2.2 数据展示测试 49
5.3 系统非功能性测试 49
5.4 本章小结 49
6 总结与展望 50
参考文献 51
致谢 52
猜你喜欢
-
基于FPGA技术的数字存储示波器毕业设计论文+任务书+开题报告
2021-06-08 -
过桥齿轮轴机械加工工艺及工装夹具设计 说明书(论文)+任务书+工艺卡片+CAD图纸+Proe图纸
2021-06-08 -
基于FPGA的智能小车系统毕业论文+任务书+开题报告+翻译及原文+电路图及程序
2021-06-09 -
基于双目立体视觉的工件识别定位与抓取系统研究硕士论文
2021-06-10 -
基于Python的豆瓣Top250排行榜影片数据爬取和分析毕业论文+开题报告+答辩PPT+视频讲解+项目源码及运行结果
2021-06-08 -
JSP动态电子购物网站前后台设计论文+任务书+开题报告+中期+设计源码
2021-06-10 -
电梯制动控制与保护系统仿真设计论文+翻译+答辩+cad图纸+动画
2021-06-10 -
浅析黄庄派出所辖区内赌博现象问题-以赌博机赌博为例毕业论文+开题报告
2021-06-09 -
基于SSH的网上购物系统设计与实现毕业论文+任务书+中期表+翻译及原文+答辩PPT+源码+数据库+辅导视频
2021-06-08 -
TND360数控车床纵向进给系统设计说明书(论文)+任务书+cad图纸
2021-06-08
-
中学数学课程标准(教学大纲)的传承与变迁 毕业论文+初稿+参考文献
2021-06-10 -
江西省某县中型水闸工程设计毕业论文+任务书+开题报告+答辩PPT+cad图纸+检测报告
2021-06-09 -
年产2万吨山楂酒工厂的设计—发酵工段及车间的设计毕业论文+任务书+cad图纸
2021-06-09 -
基于JavaWeb的健身俱乐部会员管理系统设计与实现毕业论文+任务书+中期表+答辩PPT+翻译及原文+源码+数据库+辅导视频
2021-06-08 -
基于BS的在线考试系统设计与开发毕业论文+任务书+开题报告+外文翻译及原文+答辩PPT+项目源码及数据库
2021-06-08 -
基于J2EE的高校毕业生就业信息管理系统设计与实现毕业论文+任务书+开题报告+中期报告+外文翻译及原文+运行说明+图例源文件+项目源码及数据库文件
2021-06-08 -
基于Python的微博情感分析研究设计 毕业论文+源码
2021-06-08 -
GSM无线网络优化设计毕业论文
2021-06-10 -
输电线路故障测距定位研究毕业论文+任务书
2021-06-10 -
ZH1105机体三面攻丝组合机床设计(左主轴箱设计)说明书(论文)+任务书+开题+文献综述+实习报告+cad图纸
2021-06-08
猜你在找
99源码网 » 基于python开源爬虫框架scrapy的租房信息爬取系统毕业论文+任务书+外文翻译及原文+答辩PPT+项目源码及数据库
常见问题FAQ
- 免费下载或者VIP会员专享资源能否直接商用?
- 本站所有资源版权均属于原作者所有,这里所提供资源均只能用于参考学习用,请勿直接商用。若由于商用引起版权纠纷,一切责任均由使用者承担。更多说明请参考 VIP介绍。
- 提示下载完但解压或打开不了?
- 找不到素材资源介绍文章里的示例图片?
- 99源码网
- 2021-06-08Hi,初次和大家见面了,请多关照!