Python爬虫老手也常踩的坑:requests.get()不加timeout参数,你的程序可能永远卡住
·
Python网络请求的健壮性设计:从超时陷阱到工程化实践
第一次在凌晨三点被报警短信吵醒时,我还以为是服务器宕机了。查看日志才发现,是一个看似简单的爬虫脚本卡在了某个电商网站的商品详情页请求上——没有设置timeout参数的requests.get()调用,让整个任务队列停滞了六个小时。这种"低级错误"带来的教训,往往比任何教材都深刻。
1. 为什么每个requests调用都需要超时保护
2018年GitHub的一项调查显示,超过34%的Python开发者从未在requests库中使用过timeout参数。这个数字在今天可能有所下降,但忽视超时设置仍然是生产环境中最常见的错误之一。
未设置超时的请求就像没有保险绳的攀岩者,可能面临多种风险场景:
- 僵尸请求:当目标服务器停止响应但保持TCP连接时,线程/进程会永久挂起
- 资源泄漏:连接池被占满后,后续合法请求无法获取连接
- 级联故障:在微服务架构中,一个服务的阻塞可能引发整个系统雪崩
# 危险示范:没有超时保护的请求
response = requests.get("https://unstable-api.example.com/data")
# 安全基准:至少设置全局超时
response = requests.get("https://api.example.com/data", timeout=10)
提示:即使对"可靠"的内部API也应该设置超时。网络分区、配置错误等情况随时可能发生。
2. 深入理解requests的超时机制
2.1 连接超时 vs 读取超时
requests库的timeout参数实际上控制着两个独立的阶段:
| 超时类型 | 触发阶段 | 典型值范围 | 对应底层操作 |
|---|---|---|---|
| 连接超时 | TCP握手到建立完整连接 | 3-10秒 | socket.connect() |
| 读取超时 | 从连接建立到接收完整响应 | 5-30秒 | socket.recv() |
# 分别设置连接超时(3秒)和读取超时(7秒)
response = requests.get(url, timeout=(3, 7))
2.2 不同场景下的超时策略
根据目标服务的特性,需要采用差异化的超时配置:
-
高延迟网络爬虫:
# 宽松的读取超时应对慢速网站 timeout = (5, 30) # 连接5秒,读取30秒 -
金融数据API调用:
# 严格的全局超时确保实时性 timeout = 2 # 连接+读取总计不超过2秒 -
文件下载服务:
# 快速失败连接+宽松读取 timeout = (3, None) # 3秒连接超时,无读取限制
3. 超越基础:构建健壮的网络客户端
3.1 使用Session管理连接
with requests.Session() as session:
session.request_timeout = 5 # 默认超时
adapter = requests.adapters.HTTPAdapter(
max_retries=3,
pool_connections=10,
pool_maxsize=100
)
session.mount('https://', adapter)
# 所有请求自动继承超时设置
response = session.get('https://api.example.com')
3.2 实现智能重试机制
from urllib3.util import Retry
from requests.adapters import HTTPAdapter
retry_strategy = Retry(
total=3,
backoff_factor=1,
status_forcelist=[500, 502, 503, 504]
)
adapter = HTTPAdapter(max_retries=retry_strategy)
session = requests.Session()
session.mount("https://", adapter)
try:
response = session.get(url, timeout=(3, 7))
except requests.exceptions.RequestException as e:
logger.error(f"Request failed after retries: {str(e)}")
3.3 超时与重试的最佳实践组合
-
分层设置超时:
- 连接层:3-5秒
- 读取层:根据响应大小调整
- 应用层:总耗时不超过业务容忍度
-
指数退避重试:
Retry( total=3, backoff_factor=0.5, # 重试间隔:0.5s, 1s, 2s allowed_methods=["GET", "POST"] ) -
熔断机制:
- 当错误率超过阈值时,暂时停止请求
- 使用circuitbreaker等库实现
4. 实战:处理特殊网络环境
4.1 代理环境下的超时陷阱
proxies = {
'http': 'http://proxy.example.com:8080',
'https': 'http://proxy.example.com:8080',
}
# 代理需要更长的连接超时
timeout = (10, 30) # 代理连接10秒,读取30秒
response = requests.get(url, proxies=proxies, timeout=timeout)
4.2 处理慢启动连接
某些CDN或云服务会有意延迟初始响应:
# 分阶段超时设置
try:
# 快速建立连接
response = requests.get(url, timeout=(3, 2))
except requests.exceptions.ReadTimeout:
# 首次读取超时后延长等待
response = requests.get(url, timeout=(3, 10))
4.3 DNS查询超时问题
import socket
from requests.packages.urllib3.util.connection import allowed_gai_family
# 设置DNS解析超时为3秒
socket.setdefaulttimeout(3)
class FastHTTPAdapter(HTTPAdapter):
def init_poolmanager(self, *args, **kwargs):
kwargs['socket_options'] = [
(socket.SOL_SOCKET, socket.SO_KEEPALIVE, 1),
]
return super().init_poolmanager(*args, **kwargs)
# 使用自定义适配器
session = requests.Session()
session.mount('http://', FastHTTPAdapter())
在经历了多次线上事故后,我现在每个requests调用都会显式设置timeout。对于关键业务系统,还会在架构层面添加额外的超时控制,比如Celery任务的硬时限或gRPC的deadline机制。记住:网络是不可靠的,但我们的代码必须可靠。
更多推荐


所有评论(0)