成人网站PornHub爬虫分享(一天可爬取500万以上的视频)

成人网站PornHub爬虫分享(一天可爬取500万以上的视频)

作者: xiyouMc | 来源:发表于2017-04-09 02:17 被阅读2482次

来自公众号 : DeveloperPython

声明：本项目旨在学习Scrapy爬虫框架和MongoDB数据库，不可使用于商业和个人其他意图。若使用不当，均由个人承担。

PornHubBot

源代码地址

PornHubBot项目主要是爬取全球最大成人网站PornHub的视频标题、时长、mp4链接、封面URL和具体的PornHub链接
项目爬的是PornHub.com，结构简单，速度飞快
爬取PornHub视频的速度可以达到500万/天以上。具体视个人网络情况,因为我是家庭网络，所以相对慢一点。
10个线程同时请求，可达到如上速度。若个人网络环境更好，可启动更多线程来请求，具体配置方法见 [启动前配置]

环境、架构

开发语言: Python2.7

开发环境: MacOS系统、4G内存

数据库: MongoDB

主要使用 scrapy 爬虫框架
从Cookie池和UA池中随机抽取一个加入到Spider
start_requests 根据 PorbHub 的分类，启动了5个Request，同时对五个分类进行爬取。
并支持分页爬取数据，并加入到待爬队列。

使用说明

启动前配置

安装MongoDB,并启动，不需要配置
安装Scrapy
安装Python的依赖模块：pymongo、json、requests
根据自己需要修改 Scrapy 中关于间隔时间、启动Requests线程数等得配置

启动

python PornHub/quickstart.py

运行截图

数据库说明

数据库中保存数据的表是 PhRes。以下是字段说明:

PhRes 表：

video_title:视频的标题,并作为唯一标识.
link_url:视频调转到PornHub的链接
image_url:视频的封面链接
video_duration:视频的时长，以 s 为单位
quality_480p: 视频480p的 mp4 下载地址

相关文章

网友评论

梦中一点心雨:会不会被网警给太监了
xiyouMc:@梦中一点心雨我公众号有篇说这件事的文章。
eada0f3cc167:屌的起飞
xiyouMc:@cobranail
帅气的y哥:
xiyouMc:@帅气的y哥
雀知安:是原创么，在别处看到了一样的文章
xiyouMc:@花小橙谢谢哦。记得关注公众号。
雀知安:@xiyouMc 赞，
xiyouMc:@花小橙是原创。我是作者。
Valinor:这个很强大啊
xiyouMc:@Valinor 小东西啦
C_Sev:可以学习你的代码吗？？
xiyouMc:@晴天之助可以的。关注公众号。代码也在Github开源
Jonny没文化:你这不会被干掉吧
xiyouMc:@Jonny没文化不会啊。在Github上1700赞了

本文标题：成人网站PornHub爬虫分享(一天可爬取500万以上的视频)

本文链接：https://www.haomeiwen.com/subject/ekorattx.html

延伸阅读

深度阅读

您也可以注册成为美文阅读网的作者，发表您的原创作品、分享您的心情！

栏目导航

程序员之道

GitHub上有趣的资源

热点阅读

程序员之道

@IT·互联网

中转站

程序员

GitHub上有趣的资源

关于我们|服务条款|联系我们|成人网站PornHub爬虫分享(一天可爬取500万以上的视频)|投稿指南|网站地图|RSS订阅|排版工具|手机版

提供经典美文摘抄,优美散文欣赏,现代诗歌精选,短篇小说,心情随笔,表白情书范文,故事会在线阅读欣赏

Copyright © 2014-2023 Haomeiwen.com All Rights Reserved. 好美文阅读网版权所有

备案信息：桂公网安备 45052102000051号 · 桂ICP备13007215号-3

本站所收录作品、热点评论等信息部分来源互联网，目的只是为了系统归纳学习和传递资讯

所有作品版权归原创作者所有，与本站立场无关，如不慎侵犯了你的权益，请联系我们告知，我们将做删除处理！