备案控制台

开发者社区

开发者社区大数据文章正文

Python爬虫抓取图片，网址从文件中读取

2015-03-31 1119

版权

版权声明：

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： 利用python抓取网络图片的步骤： 1.根据给定的网址获取网页源代码 2.利用正则表达式把源代码中的图片地址过滤出来 3.根据过滤出来的图片地址下载网络图片 import urllib import re import os ...

利用python抓取网络图片的步骤：

1.根据给定的网址获取网页源代码

2.利用正则表达式把源代码中的图片地址过滤出来

3.根据过滤出来的图片地址下载网络图片

import urllib
import re
import os
#urllib,re,os均为Python模块
def gethtml(outline):
page = urllib.urlopen(outline) #抓取网页内容获得图片链接
html = page.read()
return html

def getimg(html): #下载图片保存在同目录下的pictures文件夹下
reg=r'src="(.+?\.jpg)" pic_ext'
imgre=re.compile(reg)
imglist=imgre.findall(html)
if not imglist:
print "not found"
else:
filepath=os.getcwd() +'\pictures'
print filepath
if os.path.exists(filepath) is False:
os.mkdir(filepath)
global x
for imgurl in imglist:
temp = filepath + '\%s.jpg' % x
print imgurl
urllib.urlretrieve(imgurl,temp)
x=x+1

x = 0
fp =file("img_path.txt") #所有网址都放在这个文件里
while True:
outline = fp.readline().strip('\n')
if len(outline)==0:
break
print outline
html=gethtml(outline)
getimg(html)

fp.close()

文章标签：

Python

数据采集

关键词：

爬虫python

Python爬虫

Python文件

Python图片

Python抓取

thinkgamer.cn

目录

相关文章

桃李春风一杯酒

|

13天前

|

数据采集存储 API

网络爬虫与数据采集：使用Python自动化获取网页数据

【4月更文挑战第12天】本文介绍了Python网络爬虫的基础知识，包括网络爬虫概念（请求网页、解析、存储数据和处理异常）和Python常用的爬虫库requests（发送HTTP请求）与BeautifulSoup（解析HTML）。通过基本流程示例展示了如何导入库、发送请求、解析网页、提取数据、存储数据及处理异常。还提到了Python爬虫的实际应用，如获取新闻数据和商品信息。

桃李春风一杯酒

33 2 2

java开发-郭老师

|

16天前

|

数据采集 Python

【python】爬虫-西安医学院-校长信箱

本文以西安医学院-校长信箱为基础来展示爬虫案例。来介绍python爬虫。

java开发-郭老师

19 0 0

【python】爬虫-西安医学院-校长信箱

长梦

|

2天前

|

数据采集存储 JSON

Python爬虫面试：requests、BeautifulSoup与Scrapy详解

【4月更文挑战第19天】本文聚焦于Python爬虫面试中的核心库——requests、BeautifulSoup和Scrapy。讲解了它们的常见问题、易错点及应对策略。对于requests，强调了异常处理、代理设置和请求重试；BeautifulSoup部分提到选择器使用、动态内容处理和解析效率优化；而Scrapy则关注项目架构、数据存储和分布式爬虫。通过实例代码，帮助读者深化理解并提升面试表现。

长梦

12 0 0

1941623231718325

|

6天前

|

数据采集 JavaScript 前端开发

使用Python打造爬虫程序之破茧而出：Python爬虫遭遇反爬虫机制及应对策略

【4月更文挑战第19天】本文探讨了Python爬虫应对反爬虫机制的策略。常见的反爬虫机制包括User-Agent检测、IP限制、动态加载内容、验证码验证和Cookie跟踪。应对策略包括设置合理User-Agent、使用代理IP、处理动态加载内容、验证码识别及维护Cookie。此外，还提到高级策略如降低请求频率、模拟人类行为、分布式爬虫和学习网站规则。开发者需不断学习新策略，同时遵守规则和法律法规，确保爬虫的稳定性和合法性。

1941623231718325

15 1 1

阿文没烦恼

|

6天前

|

存储 Python

用Python实现批量下载文件——代理ip排除万难

用Python实现批量下载文件——代理ip排除万难

阿文没烦恼

19 2 2

江帅帅

|

6天前

|

JSON 关系型数据库数据库

《Python 简易速速上手小册》第6章：Python 文件和数据持久化（2024 最新版）

《Python 简易速速上手小册》第6章：Python 文件和数据持久化（2024 最新版）

江帅帅

33 0 0

江帅帅

|

6天前

|

数据挖掘索引 Python

Python 读写 Excel 文件

Python 读写 Excel 文件

江帅帅

12 0 0

皮牙子抓饭

|

6天前

|

机器学习/深度学习算法自动驾驶

opencv python 图片叠加

【4月更文挑战第17天】

皮牙子抓饭

20 0 0

长梦

|

6天前

|

数据安全/隐私保护 Python

Python文件与目录操作：面试中的高频考点

【4月更文挑战第15天】本文介绍了Python文件和目录操作的面试重点，包括文件的读写、目录遍历及权限管理。强调了文件关闭、异常处理、特殊文件判断以及权限位和权限字符串的理解。提供了代码示例，如读写文件、遍历目录和更改文件权限，帮助读者在面试中表现出色。掌握这些技能将对编程求职之路大有裨益。

长梦

17 0 0

cuicuicuic

|

8天前

|

存储监控开发工具

对象存储OSS产品常见问题之python sdk中的append_object方法支持追加上传xls文件如何解决

对象存储OSS是基于互联网的数据存储服务模式，让用户可以安全、可靠地存储大量非结构化数据，如图片、音频、视频、文档等任意类型文件，并通过简单的基于HTTP/HTTPS协议的RESTful API接口进行访问和管理。本帖梳理了用户在实际使用中可能遇到的各种常见问题，涵盖了基础操作、性能优化、安全设置、费用管理、数据备份与恢复、跨区域同步、API接口调用等多个方面。

cuicuicuic

38 9 9

热门文章

最新文章

阿里云 MaxCompute MaxFrame 开启免费邀测，统一 Python 开发生态

使用Python实现DBSCAN聚类算法

在Python Web开发过程中：数据库与缓存，MySQL和NoSQL数据库的主要差异是什么？

流畅的 Python 第二版（GPT 重译）（一）(1)

【Python】python天气数据抓取与数据分析（源码+论文）【独一无二】

Python 学习之路 01基础入门---【Python安装，Python程序基本组成】

流畅的 Python 第二版（GPT 重译）（十一）(1)

Python 数据分析（PYDA）第三版（三）（1）

Python函数使用(四)

Python速成篇（基础语法）上

【AI大模型应用开发】【LangChain系列】实战案例2：通过URL加载网页内容 - LangChain对爬虫功能的封装

Python爬虫面试：requests、BeautifulSoup与Scrapy详解

使用Python打造爬虫程序之破茧而出：Python爬虫遭遇反爬虫机制及应对策略

畅游网络：构建C++网络爬虫的指南

网络爬虫与数据采集：使用Python自动化获取网页数据

掌握 C# 爬虫技术：使用 HttpClient 获取今日头条内容

【python】爬虫-西安医学院-校长信箱

Python爬虫如何快速入门

简单描述一下爬虫的工作原理。

python并发编程:Python实现生产者消费者爬虫

相关课程

更多

Python语言基础 - 语法入门

Python语言基础 - 列表、元组、字典、集合

Python网络编程

Python Web 框架 Django 快速入门

Python爬虫实战

Python网络爬虫实战

相关电子书

更多

Improving Python and Spark

Improving Python and Spark Per

From Python Scikit-Learn to Sc

相关实验场景

更多

Python新手入门

Python入门

Python选择及循环结构

Python新手入门（Anolis OS）

Python网络通信程序典型应用

下一篇

部署LAMP环境（Alibaba Cloud Linux 3）