js爬虫，正则

js爬虫，正则

作者: 偷了月光的猫 | 来源:发表于2018-12-14 14:50 被阅读2次

js爬虫，正则
scrapy学习笔记（五）
爬虫初窥
爬虫入门(1)-使用re和requeset
正则初解
JS正则表达式
python爬虫学习-day7-实战
Python 基础爬虫目录
python爬虫学习-day5-selenium
python爬虫学习-day6-ip池

Python爬虫学习，记一次抓包获取js，从js函数中取数据的过程

昨天有小伙伴找我，新浪新闻的国内新闻页，其他部分都是静态网页可以抓到，但是在左下方的最新新闻部分，不是静态网页，也没有json数据，让我帮忙抓一下。大概看了下，是js加载的，而且数据在js函数中，很有意思，就分享出来给大家一起看看！

抓取目标

今天我们的目标是上图红框部分，首先我们确定这部分内容不在网页源代码中，属于js加载的部分，点击翻页后也没有json数据传输！

但是发现有个js的请求，点击请求，是一行js函数代码，我们将其复制到json的视图查看器中，然后格式化一下，看看结果

发现里面有可能存在我们需要的内容，比如url、title、intro这3个参数，猜测就是对应的新闻URL、标题、简介

只是其内容，需要在进行处理一下，我们写到代码中看看

开始写代码

先导入库，因为最终需要从字符串中截取部分，所以用requests库获取请求，正则re匹配内容即可。然后我们先匹配出上述3项

可以看到，url中存在 \ \，标题和简介是以\ \ u4e09的形式存在，这些就是我们需要处理的下一步了！

先用replace函数剔除url中\ \，即可得到url，后面的\ \ u4e09则是unicode编码，可以直接解码得到内容，直接写代码了

解码用了eval函数，内容为u“ + unicode编码内容 + “的形式即可解码！

这样，就取出了本页的所有新闻和URL的相关内容，在外层加上循环，即可抓取所有的新闻页，任务完成！

相关文章

js爬虫，正则
Python爬虫学习，记一次抓包获取js，从js函数中取数据的过程昨天有小伙伴找我，新浪新闻的国内新闻页，其他部...
scrapy学习笔记（五）
面对实际问题中的问题，用智慧解决。这篇讲一个python调用scrapy执行爬虫，并用正则表达式方法提取JS信息...
爬虫初窥
静态爬虫和动态爬虫静态爬虫：页面数据的展示不依靠js等和后台的交互。动态爬虫：页面的数据需要通过js，ajax等...
爬虫入门(1)-使用re和requeset
前言编写爬虫需要了解正则表达式，网上内容很多，但在爬虫应用中用到最多的正则表达式是 ‘(.*?)’ 在Pytho...
正则初解
title: js验证常用正则表达式date: 2017-03-03 验证正则表达式本文介绍js验证常用的正则...
JS正则表达式
JS正则表达式一条龙讲解，从原理和语法到JS正则、ES6正则扩展，最后再到正则实践思路 Stinson 关注 20...
python爬虫学习-day7-实战
目录 python爬虫学习-day1 python爬虫学习-day2正则表达式 python爬虫学习-day3-B...
Python 基础爬虫目录
目录 python爬虫学习-day1 python爬虫学习-day2正则表达式 python爬虫学习-day3-B...
python爬虫学习-day5-selenium
目录 python爬虫学习-day1 python爬虫学习-day2正则表达式 python爬虫学习-day3-B...
python爬虫学习-day6-ip池
目录 python爬虫学习-day1 python爬虫学习-day2正则表达式 python爬虫学习-day3-B...

网友评论

本文标题：js爬虫，正则

本文链接：https://www.haomeiwen.com/subject/uyrghqtx.html

延伸阅读

深度阅读

您也可以注册成为美文阅读网的作者，发表您的原创作品、分享您的心情！

栏目导航

热点阅读

关于我们|服务条款|联系我们|js爬虫，正则|投稿指南|网站地图|RSS订阅|排版工具|手机版

提供经典美文摘抄,优美散文欣赏,现代诗歌精选,短篇小说,心情随笔,表白情书范文,故事会在线阅读欣赏

Copyright © 2014-2023 Haomeiwen.com All Rights Reserved. 好美文阅读网版权所有

备案信息：桂公网安备 45052102000051号 · 桂ICP备13007215号-3

本站所收录作品、热点评论等信息部分来源互联网，目的只是为了系统归纳学习和传递资讯

所有作品版权归原创作者所有，与本站立场无关，如不慎侵犯了你的权益，请联系我们告知，我们将做删除处理！