在Python中调用大模型API时,经常遇到网络超时、限流(429)或服务端5xx错误。如果直接失败,采集任务可能中断;如果盲目重试,可能加重服务压力。本文以requests库为例,实现指数退避重试、熔断和降级机制,确保采集任务稳定完成。
一、问题现象与业务约束
假设我们有一个定时任务,需要从多个大模型API获取回答,用于后续分析。实际运行中,我们遇到以下问题:
- 网络抖动导致连接超时,任务失败。
- 调用频率过高触发限流(HTTP 429)。
- 服务端偶尔返回500、502、503。
- 批量任务中,单个失败导致整个批次失败。
业务约束:
- 实时性要求不高,但数据完整性要求高。
- 需要控制请求速率,避免被封。
- 系统需要可观测,便于排查。
二、异常分类与处理策略
根据异常类型,我们采取不同策略:
- 网络异常(超时、连接错误):瞬时故障,重试。
- HTTP 5xx(500、502、503):服务端暂时不可用,重试。
- HTTP 429(限流):等待后重试,并考虑熔断。
- HTTP 4xx(400、401等):客户端错误,不重试。
- 业务异常(返回内容格式错误):不重试,记录并跳过。
三、重试机制设计
1. 重试条件
只对以下情况重试:
requests.exceptions.Timeoutrequests.exceptions.ConnectionError- HTTP 状态码为429、500、502、503
其他异常直接抛出或记录。
2. 指数退避与抖动
重试间隔采用指数退避,并加入随机抖动,避免多个请求同时重试造成雪崩。
import random
import time
def get_backoff_time(attempt, base_delay=1, max_delay=60):
"""计算重试等待时间,指数退避加抖动"""
delay = min(max_delay, base_delay * (2 ** attempt))
jitter = random.uniform(0, delay * 0.1)
return delay + jitter
3. 最大重试次数
设置最大重试次数(如3次),超过后放弃并记录失败日志。
4. 重试装饰器实现
以下是一个重试装饰器,用于包裹API调用函数:
import functools
import time
import logging
import requests
logger = logging.getLogger(__name__)
def retry_on_failure(max_retries=3, base_delay=1, max_delay=60):
def decorator(func):
@functools.wraps(func)
def wrapper(*args, **kwargs):
for attempt in range(max_retries):
try:
return func(*args, **kwargs)
except (requests.exceptions.Timeout, requests.exceptions.ConnectionError) as e:
if attempt == max_retries - 1:
raise
delay = get_backoff_time(attempt, base_delay, max_delay)
logger.warning(f"Attempt {attempt+1} failed: {e}, retrying in {delay:.2f}s")
time.sleep(delay)
except requests.exceptions.HTTPError as e:
if e.response.status_code in (429, 500, 502, 503):
if attempt == max_retries - 1:
raise
delay = get_backoff_time(attempt, base_delay, max_delay)
logger.warning(f"HTTP {e.response.status_code} on attempt {attempt+1}, retrying in {delay:.2f}s")
time.sleep(delay)
else:
raise
return None
return wrapper
return decorator
使用示例:
@retry_on_failure(max_retries=3, base_delay=1, max_delay=60)
def call_ai_service(prompt):
response = requests.post("https://api.example.com/v1/completions", json={"prompt": prompt}, timeout=5)
response.raise_for_status()
return response.json()
四、熔断机制
当某个服务持续失败时,继续重试只会浪费资源。引入熔断器,当失败率达到阈值时,暂时停止调用,快速失败。
1. 熔断器状态
- 关闭:正常调用。
- 打开:熔断,直接抛出异常。
- 半开:允许少量请求试探,成功则关闭,失败则重新打开。
2. 使用pybreaker实现
pybreaker是一个Python熔断器库,安装:
pip install pybreaker
配置示例:
import pybreaker
breaker = pybreaker.CircuitBreaker(fail_max=5, reset_timeout=60)
@breaker
@retry_on_failure()
def call_ai_service(prompt):
# 实际调用代码
pass
当连续失败5次后,熔断器打开,后续调用直接抛出CircuitBreakerError。60秒后进入半开状态,允许少量请求试探,成功则关闭熔断器。
注意:fail_max和reset_timeout需根据业务调整。
五、降级策略
当重试和熔断都无法解决问题时,需要降级处理:
- 备用模型:主模型不可用时,切换到备用模型。
- 缓存结果:相同问题直接使用缓存。
- 延迟处理:将任务放入队列,稍后重试。
在我们的系统中,当熔断器打开时,将任务标记为“待重试”,由定时任务在稍后重新执行。
验证结果
为了验证重试机制,可以模拟超时和500错误。正常情况下应当看到以下现象:
- 模拟超时:设置超时时间为0.1秒,服务端延迟0.5秒,重试3次后成功。
- 模拟500错误:服务端返回500,重试3次后成功。
重试日志会显示每次重试的等待时间,最终成功。
验证方法:
- 检查日志中是否有重试记录。
- 确认最终调用成功。
- 统计重试次数是否符合预期。
常见问题与避坑
1. 重试导致请求重复
如果API不是幂等的,重试可能产生重复请求。解决方案:使用请求ID去重,确保同一请求只被处理一次。
2. 退避时间过长
如果基础延迟设置过大,重试间隔可能过长,影响效率。需要根据业务容忍度调整参数。
3. 熔断误判
如果某个服务偶尔超时,但整体健康,熔断可能误判。通过设置合理的失败阈值和采样窗口来减少误判。
总结
本文解决了Python调用大模型API时的异常处理问题。根因是网络和服务端不稳定,最终采用指数退避重试、熔断和降级策略。方案适用于对实时性要求不高的采集场景,但需要根据业务调整参数。当前限制:未考虑动态超时和基于历史数据的退避调整,未来可进一步优化。

191

被折叠的 条评论
为什么被折叠?



