linux系统 scrapy第一个程序报错求大佬帮忙看看

2021-03-28 22:10:19 [scrapy.utils.log] INFO: Scrapy 2.4.1 started (bot: demo1)
2021-03-28 22:10:19 [scrapy.utils.log] INFO: Versions: lxml 4.6.2.0, libxml2 2.9.10, cssselect 1.1.0, parsel 1.6.0, w3lib 1.22.0, Twisted 20.3.0, Python 3.7.3 (default, Nov 27 2020, 09:27:44) - [GCC 8.3.0], pyOpenSSL 20.0.1 (OpenSSL 1.1.1d  10 Sep 2019), cryptography 2.6.1, Platform Linux-5.4.70-amd64-desktop-x86_64-with-Deepin-20.1-apricot
2021-03-28 22:10:19 [scrapy.utils.log] DEBUG: Using reactor: twisted.internet.epollreactor.EPollReactor
2021-03-28 22:10:19 [scrapy.crawler] INFO: Overridden settings:
{'BOT_NAME': 'demo1',
 'DOWNLOAD_DELAY': 3,
 'NEWSPIDER_MODULE': 'demo1.spiders',
 'SPIDER_MODULES': ['demo1.spiders'],
 'USER_AGENT': 'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, '
               'like Gecko) Chrome/88.0.4324.182 Safari/537.36'}
2021-03-28 22:10:19 [scrapy.extensions.telnet] INFO: Telnet Password: 49b4c0e84af998cf
2021-03-28 22:10:19 [scrapy.middleware] INFO: Enabled extensions:
['scrapy.extensions.corestats.CoreStats',
 'scrapy.extensions.telnet.TelnetConsole',
 'scrapy.extensions.memusage.MemoryUsage',
 'scrapy.extensions.logstats.LogStats']
2021-03-28 22:10:19 [scrapy.middleware] INFO: Enabled downloader middlewares:
['scrapy.downloadermiddlewares.httpauth.HttpAuthMiddleware',
 'scrapy.downloadermiddlewares.downloadtimeout.DownloadTimeoutMiddleware',
 'scrapy.downloadermiddlewares.defaultheaders.DefaultHeadersMiddleware',
 'scrapy.downloadermiddlewares.useragent.UserAgentMiddleware',
 'scrapy.downloadermiddlewares.retry.RetryMiddleware',
 'scrapy.downloadermiddlewares.redirect.MetaRefreshMiddleware',
 'scrapy.downloadermiddlewares.httpcompression.HttpCompressionMiddleware',
 'scrapy.downloadermiddlewares.redirect.RedirectMiddleware',
 'scrapy.downloadermiddlewares.cookies.CookiesMiddleware',
 'scrapy.downloadermiddlewares.httpproxy.HttpProxyMiddleware',
 'scrapy.downloadermiddlewares.stats.DownloaderStats']
2021-03-28 22:10:19 [scrapy.middleware] INFO: Enabled spider middlewares:
['scrapy.spidermiddlewares.httperror.HttpErrorMiddleware',
 'scrapy.spidermiddlewares.offsite.OffsiteMiddleware',
 'scrapy.spidermiddlewares.referer.RefererMiddleware',
 'scrapy.spidermiddlewares.urllength.UrlLengthMiddleware',
 'scrapy.spidermiddlewares.depth.DepthMiddleware']
2021-03-28 22:10:19 [scrapy.middleware] INFO: Enabled item pipelines:
[]
2021-03-28 22:10:19 [scrapy.core.engine] INFO: Spider opened
2021-03-28 22:10:19 [scrapy.extensions.logstats] INFO: Crawled 0 pages (at 0 pages/min), scraped 0 items (at 0 items/min)
2021-03-28 22:10:19 [scrapy.extensions.telnet] INFO: Telnet console listening on 127.0.0.1:6023
2021-03-28 22:10:19 [scrapy.core.scraper] ERROR: Error downloading <GET http://python123.io/ws/demo.html>
Traceback (most recent call last):
  File "/usr/local/lib/python3.7/dist-packages/twisted/internet/defer.py", line 1416, in _inlineCallbacks
    result = result.throwExceptionIntoGenerator(g)
  File "/usr/local/lib/python3.7/dist-packages/twisted/python/failure.py", line 512, in throwExceptionIntoGenerator
    return g.throw(self.type, self.value, self.tb)
  File "/home/ppddwm/.local/lib/python3.7/site-packages/scrapy/core/downloader/middleware.py", line 45, in process_request
    return (yield download_func(request=request, spider=spider))
  File "/home/ppddwm/.local/lib/python3.7/site-packages/scrapy/utils/defer.py", line 55, in mustbe_deferred
    result = f(*args, **kw)
  File "/home/ppddwm/.local/lib/python3.7/site-packages/scrapy/core/downloader/handlers/__init__.py", line 75, in download_request
    return handler.download_request(request, spider)
  File "/home/ppddwm/.local/lib/python3.7/site-packages/scrapy/core/downloader/handlers/http11.py", line 88, in download_request
    return agent.download_request(request)
  File "/home/ppddwm/.local/lib/python3.7/site-packages/scrapy/core/downloader/handlers/http11.py", line 355, in download_request
    d = agent.request(method, to_bytes(url, encoding='ascii'), headers, bodyproducer)
  File "/usr/local/lib/python3.7/dist-packages/twisted/web/client.py", line 1744, in request
    parsedURI.originForm)
  File "/usr/local/lib/python3.7/dist-packages/twisted/web/client.py", line 690, in originForm
    (b'', b'', self.path, self.params, self.query, b''))
  File "/usr/local/lib/python3.7/dist-packages/twisted/web/client.py", line 22, in urlunparse
    result = _urlunparse(tuple([p.decode("charmap") for p in parts]))
  File "/usr/local/lib/python3.7/dist-packages/twisted/web/client.py", line 22, in <listcomp>
    result = _urlunparse(tuple([p.decode("charmap") for p in parts]))
LookupError: unknown encoding: charmap
2021-03-28 22:10:19 [scrapy.core.engine] INFO: Closing spider (finished)
2021-03-28 22:10:19 [scrapy.statscollectors] INFO: Dumping Scrapy stats:
{'downloader/exception_count': 1,
 'downloader/exception_type_count/builtins.LookupError': 1,
 'downloader/request_bytes': 295,
 'downloader/request_count': 1,
 'downloader/request_method_count/GET': 1,
 'elapsed_time_seconds': 0.31267,
 'finish_reason': 'finished',
 'finish_time': datetime.datetime(2021, 3, 28, 14, 10, 19, 789381),
 'log_count/ERROR': 1,
 'log_count/INFO': 10,
 'memusage/max': 52699136,
 'memusage/startup': 52699136,
 'scheduler/dequeued': 1,
 'scheduler/dequeued/memory': 1,
 'scheduler/enqueued': 1,
 'scheduler/enqueued/memory': 1,
 'start_time': datetime.datetime(2021, 3, 28, 14, 10, 19, 476711)}
2021-03-28 22:10:19 [scrapy.core.engine] INFO: Spider closed (finished)

#这是我的代码
import scrapy


class BaiduSpider(scrapy.Spider):
    name = 'baidu'
    allowed_domains = ['baidu.com']
    start_urls = ['https://www.baidu.com/']

    def parse(self, response):
        print(response.text)

# Scrapy settings for demo1 project
#
# For simplicity, this file contains only settings considered important or
# commonly used. You can find more settings consulting the documentation:
#
#     https://docs.scrapy.org/en/latest/topics/settings.html
#     https://docs.scrapy.org/en/latest/topics/downloader-middleware.html
#     https://docs.scrapy.org/en/latest/topics/spider-middleware.html

BOT_NAME = 'demo1'

SPIDER_MODULES = ['demo1.spiders']
NEWSPIDER_MODULE = 'demo1.spiders'


# Crawl responsibly by identifying yourself (and your website) on the user-agent
#USER_AGENT = 'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/88.0.4324.182 Safari/537.36'

# Obey robots.txt rules
ROBOTSTXT_OBEY =False

# Configure maximum concurrent requests performed by Scrapy (default: 16)
#CONCURRENT_REQUESTS = 32

# Configure a delay for requests for the same website (default: 0)
# See https://docs.scrapy.org/en/latest/topics/settings.html#download-delay
# See also autothrottle settings and docs
DOWNLOAD_DELAY = 3
# The download delay setting will honor only one of:
#CONCURRENT_REQUESTS_PER_DOMAIN = 16
#CONCURRENT_REQUESTS_PER_IP = 16

# Disable cookies (enabled by default)
#COOKIES_ENABLED = False

# Disable Telnet Console (enabled by default)
#TELNETCONSOLE_ENABLED = False

# Override the default request headers:
#DEFAULT_REQUEST_HEADERS = {
#   'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8',
#   'Accept-Language': 'en',
#}

# Enable or disable spider middlewares
# See https://docs.scrapy.org/en/latest/topics/spider-middleware.html
#SPIDER_MIDDLEWARES = {
#    'demo1.middlewares.Demo1SpiderMiddleware': 543,
#}

# Enable or disable downloader middlewares
# See https://docs.scrapy.org/en/latest/topics/downloader-middleware.html
#DOWNLOADER_MIDDLEWARES = {
#    'demo1.middlewares.Demo1DownloaderMiddleware': 543,
#}

# Enable or disable extensions
# See https://docs.scrapy.org/en/latest/topics/extensions.html
#EXTENSIONS = {
#    'scrapy.extensions.telnet.TelnetConsole': None,
#}

# Configure item pipelines
# See https://docs.scrapy.org/en/latest/topics/item-pipeline.html
#ITEM_PIPELINES = {
#    'demo1.pipelines.Demo1Pipeline': 300,
#}

# Enable and configure the AutoThrottle extension (disabled by default)
# See https://docs.scrapy.org/en/latest/topics/autothrottle.html
#AUTOTHROTTLE_ENABLED = True
# The initial download delay
#AUTOTHROTTLE_START_DELAY = 5
# The maximum download delay to be set in case of high latencies
#AUTOTHROTTLE_MAX_DELAY = 60
# The average number of requests Scrapy should be sending in parallel to
# each remote server
#AUTOTHROTTLE_TARGET_CONCURRENCY = 1.0
# Enable showing throttling stats for every response received:
#AUTOTHROTTLE_DEBUG = False

# Enable and configure HTTP caching (disabled by default)
# See https://docs.scrapy.org/en/latest/topics/downloader-middleware.html#httpcache-middleware-settings
#HTTPCACHE_ENABLED = True
#HTTPCACHE_EXPIRATION_SECS = 0
#HTTPCACHE_DIR = 'httpcache'
#HTTPCACHE_IGNORE_HTTP_CODES = []
#HTTPCACHE_STORAGE = 'scrapy.extensions.httpcache.FilesystemCacheStorage'

基本没改，按照视频教程一步一步来的，是不是环境问题？

写回答
好问题 0 提建议
关注问题
分享
邀请回答
编辑收藏删除结题
收藏举报

3条回答默认最新

关注

码龄粉丝数原力等级 --

被采纳

被点赞

采纳率
CSDN专家-杨俊 2021-03-29 19:51
关注
我跑一下看看先

解决无用
评论打赏
分享
举报

评论

按下Enter换行，Ctrl+Enter发表内容

报告相同问题？

关注问题

【Python报错已解决】“ModuleNotFoundError: No module named ‘mne‘”
2024-09-02 16:55

鸽芷咕的博客在神经科学研究和脑电图（EEG）数据分析中，我们可能会遇到这样一个错误信息：“ModuleNotFoundError: No module named 'mne'”。这个错误表明Python环境中没有安装MNE-Python库，它是用于处理脑电图和其他神经生理...
【Python报错已解决】ValueError: All arrays must be of the same length
2024-09-10 23:27

鸽芷咕的博客在使用Python处理数组或列表时，你可能会遇到`ValueError: All arrays must be of the same length`的错误。这个错误通常发生在尝试执行期望所有输入数组具有相同长度的操作时，但实际上输入的数组长度不同。下面...
【python报错已解决】“IndentationError: unindent does not match any outer indentation level”
2024-08-21 22:29

鸽芷咕的博客你是否在编写Python代码时遇到了“IndentationError: unindent does not match any outer indentation level”的错误？这个错误可能会让你的代码运行中断，让你感到困惑。别担心，这篇文章将为你解释这个错误的原因...
python爬虫从入门到实战笔记——第四章Scrapy框架
2020-06-28 14:17

魔仙大佬的博客 python爬虫从入门到实战笔记——第一章爬虫原理和数据爬取 python爬虫从入门到实战笔记——第二章非结构化数据和结构化数据的提取 python爬虫从入门到实战笔记——第三章动态HTML处理和机器图像识别第四章Scrapy ...
Python爬虫第一课：了解爬虫与浏览器原理
2022-10-15 15:05

DangerousPerson的博客浏览器工作原理爬虫工作原理爬虫的四个步骤requests库。
【python报错已解决】`Could not find a version that satisfies the requirement`以及`403 Forbidden (13: Permissi
2024-08-20 13:37

鸽芷咕的博客你是否在尝试安装Python包或尝试访问某些资源时遇到了`Could not find a version that satisfies the requirement`以及`403 Forbidden (13: Permission denied)`的错误？这可能是因为权限设置不当或者资源访问受限...
scrapy爬取网站子链接（含爬虫入门教程）
2021-08-26 11:39

我要用代码向我喜欢的女孩表白的博客首先，这是我第一次用scrapy在工作中，以前用过requests，但是那种小级别的东西，不适合网站级爬取，太慢了。先说需求吧： https://rpmfind.net/linux/RPM/Groups.html 爬这个网站里的每一条。点开一条 ...
【Python学习教程】Python编程基础_python编程 csdn
2024-04-27 21:47

2401_84140023的博客类型原理优点缺点编译型语言通过专门的编译器，将所有源代码一次性转换成特定平台（Windows、Linux 等）执行的机器码（以可执行文件的形式存在）。编译一次后，脱离了编译器也可以运行，并且运行效率高。可移植性差...
python笔记——【Python学习教程】Python编程基础_python编程
2024-11-30 18:15

小怡在干什么的博客我们可以使用汉语直接告诉计算机做什么，比如“Siri，打开酷狗音乐”，但使用过这些系统的读者都知道，它尚未完全成熟，再加上我们语言充满了模糊和不精确因素，使得设计一个完全理解人类语言的计算机程序，...
这篇文章才是学习scrapy高效爬虫框架的正确姿势
2020-06-10 22:24

Artisan_C的博客文章目录絮叨一下Scrapt五大基本构成1.安装2.新建项目3....Scrapy 是一套基于基于Twisted的异步处理框架，纯python实现的爬虫框架，用户只需要定制开发几个模块就可以轻松的实现一个爬虫，用来抓取
没有解决我的问题, 去提问

linux系统 scrapy第一个程序报错 求大佬帮忙看看

3条回答 默认 最新

linux系统 scrapy第一个程序报错求大佬帮忙看看

3条回答默认最新