float() 参数必须是字符串或实数，而不是 'NoneType'


# coding:utf-8
# __auth__ = "maiz"
from bs4 import BeautifulSoup
import pandas as pd
from tqdm import tqdm
import math
import requests
import lxml
import re
import time

# 构造url字典
area_dic = {#'罗湖区':'luohuqu',
            #'福田区':'futianqu',
            '南山区':'nanshanqu',
            #'盐田区':'yantianqu',
            #'宝安区':'baoanqu',
            #'龙岗区':'longgangqu',
            #'龙华区':'longhuaqu',
            #'坪山区':'pingshanqu'
           }

# 当正则表达式匹配失败时，返回默认值（errif）
def re_match(re_pattern, string, errif=None):
    try:
        return re.findall(re_pattern, string)[0].strip()
    except IndexError:
        return errif

# 主函数部分，
# 通过request获取源码，
# 通过正则表达式提取相应的字段，
# 通过BeautifulSoup包获取房子的信息，
# DataFrame存储信息

data = pd.DataFrame()

for key_, value_ in area_dic.items():

    # 加个header进行伪装
    headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/65.0.3325.146 Safari/537.36',
               'Referer': 'https://sz.lianjia.com/ershoufang/'}

    # 新建一个会话
    sess = requests.session()
    sess.get('https://sz.lianjia.com/ershoufang/', headers=headers)

    # url示例：https://sz.lianjia.com/ershoufang/luohuqu/pg2/
    url = 'https://sz.lianjia.com/ershoufang/{}/pg{}/'

    # 获取该行政区下房源记录数
    start_url = 'https://sz.lianjia.com/ershoufang/{}/'.format(value_)
    html = sess.get(start_url).text

    # print(html[:100])
    print(re.findall('共找到<span> (.*?) </span>套.*二手房', html))
    house_num = re.findall('共找到<span> (.*?) </span>套.*二手房', html)[0].strip()
    print('{}: 二手房源共计{}套'.format(key_, house_num))
    time.sleep(1)

    # 页面限制 每个行政区只能获取最多100页共计3000条房源信息
    total_page = int(math.ceil(min(3000, int(house_num)) / 30.0))
    for i in tqdm(range(total_page), desc=key_):
        html = sess.get(url.format(value_, i+1)).text
        soup = BeautifulSoup(html, 'lxml')
        info_collect = soup.find_all(class_="info clear")

        for info in info_collect:
            info_dic = {}
            # 行政区
            info_dic['area'] = key_
            # 房源的标题
            info_dic['title'] = re_match('target="_blank">(.*?)</a><!--', str(info))
            # 小区名
            info_dic['community'] = re_match('xiaoqu.*?target="_blank">(.*?)</a>', str(info))
            # 位置
            info_dic['position'] = re_match('<a href.*?target="_blank">(.*?)</a>.*?class="address">', str(info))
            # 税相关，如房本满5年
            info_dic['tax'] = re_match('class="taxfree">(.*?)</span>', str(info))
            # 总价
            info_dic['total_price'] = float(re_match('class="totalPrice totalPrice2"><span>(.*?)</span>万', str(info)))
            # 单价
            info_dic['unit_price'] = float(re_match('data-price="(.*?)"', str(info)))

            # 匹配房源标签信息，通过|切割
            # 包括面积，朝向，装修等信息
            icons = re.findall('class="houseIcon"></span>(.*?)</div>', str(info))[0].strip().split('|')
            info_dic['hourseType'] = icons[0].strip()
            info_dic['hourseSize'] = float(icons[1].replace('平米', ''))
            info_dic['direction'] = icons[2].strip()
            info_dic['fitment'] = icons[3].strip()

            # 存入DataFrame
            if data.empty:
                data = pd.DataFrame(info_dic, index=[0])
            else:
                data = data.append(info_dic, ignore_index=True)

# 去掉面积10000+平米的房源记录（离群值），查看我们爬取到的信息

data = data[data['hourseSize'] < 10000]
data.head()
print(data)

...

写回答
好问题 0 提建议
追加酬金
关注问题
分享
邀请回答
编辑收藏删除
收藏举报

2条回答默认最新

关注

码龄粉丝数原力等级 --

被采纳

被点赞

采纳率
Just Coding 2022-07-29 09:52
关注
这个函数在遇到错误时，自动返回的None类型，而与82行的float类型不兼容，就会报错；

解决办法：在上图的函数末尾，加上一句 return 0

也就是必须让其有个返回的值，不是None就行。

本回答被题主选为最佳回答 , 对您是否有帮助呢?

解决无用
评论打赏
分享
举报

评论

按下Enter换行，Ctrl+Enter发表内容

查看更多回答(1条)

报告相同问题？

关注问题

float() 参数必须是字符串或实数，而不是 'NoneType' python
2022-07-29 09:28

回答 2 已采纳这个函数在遇到错误时，自动返回的None类型，而与82行的float类型不兼容，就会报错；解决办法：在上图的函数末尾，加上一句 return 0 也就是必须让其有个返回的值，不是None就行。
函数来检查值是int还是float而不是PHP中的字符串 php
2017-07-30 22:09

回答 2 已采纳 is_numeric($value) && !is_string($value) this is what I was looking for
将float转换为字符串而不更改float
2018-02-14 18:53

回答 2 已采纳 I think you are just using the wrong format specifier: package main import ( "fmt" "strc
字符串是python中特有的数据类型_Python数据类型、字符串、运算符入门教程
2020-12-19 16:04

weixin_39640573的博客数据类型强制类型转换字符串转义字符自然字符串Unicode字符串字符串是不可变的标识符变量的命名缩进运算符运算优先级1.数据类型在python中，有4种数据类型——整数(int)、长整数(long)、浮点数(float)和复数(complex...
C语言字符串指针参数传递的问题 c语言
2022-11-10 13:10

回答 4 已采纳就是要先用字符串读入，然后根据空格拆分出所有整数呗 #include<stdio.h> #include<string.h> int get_count(const cha
Golang错误：接口转换：接口{}是bool / float…，不是字符串 json
2018-03-05 09:09

回答 1 已采纳 The error says it all: interface conversion: interface{} is bool/float64 when you are unmars
如何在Golang中将float64转换为c99十六进制字符串？
2018-07-25 19:32

回答 1 已采纳 For example, package main import ( "fmt" "math/big" ) func main() { f := new(big.Fl
4、python——基本数据类型（整形、float、字符串、字符串的拼接、布尔类型、转义字符）
2022-01-04 15:40

FanMY_71的博客 python——基本数据类型（整形、float、字符串、字符串的拼接、布尔类型、转义字符）
如何在Golang中将浮点数打印为字符串而不用科学记数法
2018-01-19 08:58

回答 2 已采纳 The package doc of fmt explains it: The %v verb is the default format, which for floating numbers
TypeError: '>=' not supported between instances of 'NoneType' and 'float' python 深度学习神经网络
2021-12-08 10:29

回答 2 已采纳已解决，标签图没有读进去，数据集的路径出错，一定要检查好图片路径！
将字符串转换为float32吗？
2016-04-03 21:52

回答 1 已采纳 float has the type float32, but strconv.ParseFloat returns float64. All you need to do is convert
字符串是python中特有的数据类型_Elements of Python_02
2020-12-19 16:04

weixin_39780784的博客数据类型Data Types1.1 简介Brief IntroductionPython3中的数据类型，类型关键字，赋值，见下表：基本数据类型一览1.1数字NumberPython3中的数字由整形int，浮点型float，复数complex构成。1.1.1整形int整形即整数，...
如何在Golang中将数字（int或float64）转换为字符串
2017-06-14 08:45

回答 3 已采纳 You may use fmt.Sprint fmt.Sprint returns string format of any variable passed to it Sample pac
python字符串描述_python 字符串总结
2020-12-04 22:06

weixin_40001519的博客 (1) len(x) :得到字符串的长度:在python中,一个标点符号,英文字母,数字,汉字的长度都是1 .(2) str(x) :将任何的其他类型数据转换成字符串类型和eval函数的功能正好相反类似于强制类型转换的函数有int(x),float(x)(3)...
python怎么把字符串变成集合_07.Python集合与字符串
2021-01-13 06:19

weixin_39940957的博客目标列表元组字典字符串公共方法变量高级知识点回顾Python 中数据类型可以分为数字型和非数字型数字型整型 (int)浮点型(float)布尔型(bool)真 True 非 0 数 —— 非零即真假 False 0复数型 (complex)主要用于科学...
没有解决我的问题, 去提问

问题事件

关注

码龄粉丝数原力等级 --

被采纳

被点赞

采纳率
系统已结题 8月6日
关注

码龄粉丝数原力等级 --

被采纳

被点赞

采纳率
已采纳回答 7月29日
关注

码龄粉丝数原力等级 --

被采纳

被点赞

采纳率
修改了问题 7月29日
关注

码龄粉丝数原力等级 --

被采纳

被点赞

采纳率
创建了问题 7月29日

悬赏问题

¥20 java在应用程序里获取不到扬声器设备
¥15 echarts动画效果的问题，请帮我添加一个动画。不要机器人回答。
¥60 许可证msc licensing软件报错显示已有相同版本软件，但是下一步显示无法读取日志目录。
¥15 Attention is all you need 的代码运行
¥15 一个服务器已经有一个系统了如果用usb再装一个系统，原来的系统会被覆盖掉吗
¥15 使用esm_msa1_t12_100M_UR50S蛋白质语言模型进行零样本预测时，终端显示出了sequence handled的进度条，但是并不出结果就自动终止回到命令提示行了是怎么回事：
¥15 前置放大电路与功率放大电路相连放大倍数出现问题
¥80 部署运行web自动化项目
¥15 腾讯云如何建立同一个项目中物模型之间的联系
¥30 VMware 云桌面水印如何添加

float() 参数必须是字符串或实数，而不是 'NoneType'

2条回答 默认 最新

这个函数在遇到错误时，自动返回的None类型，而与82行的float类型不兼容，就会报错；

解决办法：在上图的函数末尾，加上一句 return 0

也就是必须让其有个返回的值，不是None就行。

问题事件

悬赏问题

2条回答默认最新