返回列表 上一主題 發帖

[原創] python上市櫃三大法人買賣超日報資料下載

本帖最後由 koshi0413 於 2016-9-20 14:21 編輯

下面是找到的文章,用 python的可以看一下:
小弟附上的代碼是為了應付這類的,其它的就參考了,看看總沒壞處

http     +      s://zhuanlan.zhihu.com/p/20520370

0x02 通过Headers反爬虫
从用户请求的Headers反爬虫是最常见的反爬虫策略。很多网站都会对Headers的User-Agent进行检测,
还有一部分网站会对Referer进行检测(一些资源网站的防盗链就是检测Referer)。
如果遇到了这类反爬虫机制,可以直接在爬虫中添加Headers,将浏览器的User-Agent复制到爬虫的Headers中;
或者将Referer值修改为目标网站域名。对于检测Headers的反爬虫,在爬虫中修改或者添加Headers就能很好的绕过。

目前想針對這種的下手:
0x03 基于用户行为反爬虫
还有一部分网站是通过检测用户行为,例如同一IP短时间内多次访问同一页面,或者同一账户短时间内多次进行相同操作。

現在卡在這種@@
0x04 动态页面的反爬虫

TOP

本帖最後由 koshi0413 於 2016-9-21 10:09 編輯
回復  koshi0413
不錯的文章,謝謝分享。
大量爬取的時候加進一些sleep很好,避免短時間大量request造成 ...
zyzzyva 發表於 2016-9-21 09:34


動態ajax網頁  目前是用 selenium+chrome解決
只是單純想用 requests,BeautifulSoup 交互響應 的方式來解
目前解不掉@@
相關知識還不夠,少一個headers參數 都是變化式亂碼,還在思考中

ps:有查了一下,好像要用 cookie 然後在抓取 另外二參數的亂數碼(目前抓到一個,另還一還找不到規律)
不過小弟自己也不確定啦
requests.session() 好多次還是沒反應,哈哈

TOP

        靜思自在 : 站在半路,比走到目標更辛苦。
返回列表 上一主題