p861228 2018-10-12 01:45 采纳率: 100%
浏览 4601
已采纳

小白请教高手,python爬取数据遇到js隐藏div怎么办

请教一下,我最近想在政府房管部门网站爬取房产备案信息,地址:http://www.dyyscx.com/newhouse/house_table.aspx?id=828279

每个楼盘表下有个“查看”链接,点击后就会在原页面生成新的备案内容。

这一部分内容使用元素检查是可以看见的,但查看源代码却看不见。

使用network查看XHR发现有个文件“GetBuildTableByAjax.ashx”,这里面的preview中就有相关信息。

截取片段是这样的:

 物业类别:住宅  销售状态:抵预  建筑面积:117.260平米  总价:71.65万元' class='border-333333'>3单元&nbsp;3-25-1</td><td width='95' height='30' style='cursor:hand;cursor:point;' bgcolor='#FDDFAB' Title='物业类别:住宅  销售状态:抵预  建筑面积:89.730平米  总价:53.89万元' class='border-333333'>3单元&nbsp;3-25-2</td><td width='95' height='30' style='cursor:hand;cursor:point;' bgcolor='#FDDFAB' Title='物业类别:住宅  销售状态:抵预  建筑面积:120.870平米  总价:70.87万元' class='border-333333'>3单元

我看了下,原网页head里面有一段Scirpt,内容是这样的:

 <script type="text/javascript">
        function GetData(item, bulid) {
            var heightobj = document.body.scrollHeight;
            var widthobj = document.body.scrollWidth;
            $("div.overdiv").css("width", widthobj).css("height", heightobj).css("left", "0").css("top", "0").show();
            //获得显示的位置
            var height = document.body.scrollTop + document.documentElement.scrollTop;
            widthobj = (document.body.clientWidth - 199) / 2;
            heightobj = (document.documentElement.clientHeight - 60) / 2 + height;
            //显示该div
            $("div.select").css("left", widthobj).css("top", heightobj).show();
            $.post("GetBuildTableByAjax.ashx", { itemRecord: item, houseCode: bulid }, function (data) {

                document.getElementById("BuildTable").innerHTML = data;
                $("div.select").hide();
                $("div.overdiv").hide();
            });
        }
    </script>'

因为是小白,所以猜想是js隐藏了新内容的标签,导致不在原网页的源代码中显示,所以爬不到内容。

请教一下我猜想的是否正确,以及我要怎么才能获得备案信息的内容。

ps:最好是能贴个完整的方法,谢谢!!!!!!!!!

  • 写回答

3条回答 默认 最新

  • lyhsdy 2018-10-12 03:34
    关注

    以下是获取点击查看返回内容,测试可以完成爬取

    
    import requests
    def test():
        s=requests.session()
        headers={
            'Accept':'*/*',
            'Accept-Encoding':'gzip, deflate',
            'Accept-Language':'zh-CN,zh;q=0.9',
            'Connection':'keep-alive',
            'Content-Length':'43',
            'Content-Type':'application/x-www-form-urlencoded; charset=UTF-8',
            'Host':'www.dyyscx.com',
            'Origin':'http://www.dyyscx.com',
            'Referer':'http://www.dyyscx.com/newhouse/house_table.aspx?id=828279',
            'User-Agent':'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/68.0.3440.15 Safari/537.36',
            'X-Requested-With':'XMLHttpRequest'
        }
        s.headers.update(headers)
        data={
            'itemRecord':'828279',
            'houseCode':'201506250000907',
        }
        url='http://www.dyyscx.com/newhouse/GetBuildTableByAjax.ashx'
        req=s.post(url=url,data=data).text
        print(req)
    
    test()
    
    
    
    本回答被题主选为最佳回答 , 对您是否有帮助呢?
    评论
查看更多回答(2条)

报告相同问题?

悬赏问题

  • ¥20 关于线性结构的问题:希望能从头到尾完整地帮我改一下,困扰我很久了
  • ¥30 3D多模态医疗数据集-视觉问答
  • ¥20 设计一个二极管稳压值检测电路
  • ¥15 内网办公电脑进行向日葵
  • ¥15 如何输入双曲线的参数a然后画出双曲线?我输入处理函数加上后就没有用了,不知道怎么回事去掉后双曲线可以画出来
  • ¥50 WPF Lidgren.Network.Core2连接问题
  • ¥15 soildworks装配体的尺寸问题
  • ¥100 有偿寻云闪付SDK转URL技术
  • ¥30 基于信创PC发布的QT应用如何跨用户启动后输入中文
  • ¥20 非root手机,如何精准控制手机流量消耗的大小,如20M