ScrapingBee 是一种一体化的网络抓取 API。 CaptchaAI 是一种专门的验证码解决服务,您可以将其集成到您自己的抓取工具中。以下是选择每种方法的时机。
架构比较
| 方面 | 刮蜂 | 使用 CaptchaAI 构建 |
|---|---|---|
| 它是什么 | 完整的抓取API | 验证码解决API |
| 你管理 | 什么都不做——发送 URL,获取 HTML | 浏览器、代理、抓取逻辑 |
| 验证码解决 | 包含(有限类型) | 完全控制,所有类型 |
| 代理管理 | 包括 | 您提供 |
| JavaScript 渲染 | 包括 | 您设置(Selenium/Playwright) |
| 定价模型 | 每个 API 调用 | 根据验证码已解决 |
成本比较
ScrapingBee 定价(大约)
| 计划 | 积分/month | 成本 | 每次请求的费用 |
|---|---|---|---|
| 自由职业者 | 1,000 | 49 美元 | 0.049 美元 |
| 启动 | 10,000 | 99 美元 | 0.010 美元 |
| 商业 | 30,000 | 249 美元 | 0.008 美元 |
JavaScript 渲染使用 5 学分。QA 测试模式使用 10-25 个积分。
CaptchaAI + DIY 定价(大约)
| 成分 | 成本 |
|---|---|
| CaptchaAI reCAPTCHA v2 | ~$0.003/solve |
| CaptchaAI 闸机 | ~$0.002/solve |
| 代理(住宅) | ~$0.005-0.010/request |
| 服务器(VPS) | ~$20-50/month 固定 |
对于 10,000 页/month(30% 有验证码):
- ScrapingBee:~$99-249(取决于 JS/stealth 的使用情况)
- CaptchaAI 构建:约 9 美元(3,000 次解决)+ 50 美元(代理)+ 30 美元(服务器)= 约 89 美元
代码比较
刮蜂
import requests
resp = requests.get(
"https://app.scrapingbee.com/api/v1/",
params={
"api_key": "SCRAPINGBEE_KEY",
"url": "https://example.com/data",
"render_js": "true",
},
)
html = resp.text
# Parse HTML here
CaptchaAI + 您的代码
import requests
from selenium import webdriver
from selenium.webdriver.common.by import By
# You control the browser
driver = webdriver.Chrome()
driver.get("https://example.com/data")
# Detect CAPTCHA
sitekey = driver.find_element(By.CSS_SELECTOR, "[data-sitekey]").get_attribute("data-sitekey")
# Solve with CaptchaAI
resp = requests.post("https://ocr.captchaai.com/in.php", data={
"key": "YOUR_API_KEY",
"method": "userrecaptcha",
"googlekey": sitekey,
"pageurl": driver.current_url,
"json": 1,
})
# ... poll for result, inject token ...
决策矩阵
在以下情况下选择 ScrapingBee:
- 您想要零基础设施管理
- 抓取只是产品的一小部分
- 您需要偶尔提取数据
- 预算不受数量限制
- 您不需要控制验证码求解参数
在以下情况下选择CaptchaAI + DIY:
- 您需要特定的验证码类型支持(GeeTest、BLS 等)
- 高容量使得每个请求的定价昂贵
- 您需要完全控制浏览器行为
- 您想要优化每个站点的求解参数
- 您拥有用于构建和维护的工程资源
特性比较
| 特征 | 刮蜂 | CaptchaAI 构建 |
|---|---|---|
| reCAPTCHA v2/v3 | ✅ | ✅ |
| Cloudflare Turnstile | ✅ | ✅ |
| 吉测试 | ❌ | ✅(100% 率) |
| BLS CAPTCHA | ❌ | ✅(100% 率) |
| 图片验证码 | 有限的 | ✅(27,500 多种) |
| 自定义验证码类型 | ❌ | ✅ |
| 代理管理 | 包括 | 你管理 |
| JavaScript 渲染 | 包括 | 你设置了 |
| 会话管理 | 有限的 | 完全控制 |
| 自定义浏览器标志 | ❌ | ✅ |
| Webhook/callback | ❌ | ✅ |
| v3 的最低分数 | ❌ | ✅ |
混合方法
对于简单页面使用 ScrapingBee,对于验证码较多的页面使用 CaptchaAI:
def smart_scrape(url, scrapingbee_key, captchaai_key):
"""Use ScrapingBee for simple pages, CaptchaAI for complex ones."""
# Try ScrapingBee first (simpler)
resp = requests.get(
"https://app.scrapingbee.com/api/v1/",
params={"api_key": scrapingbee_key, "url": url},
)
if "captcha" not in resp.text.lower():
return resp.text # No CAPTCHA, use ScrapingBee result
# CAPTCHA detected, use CaptchaAI for full control
return solve_with_captchaai(url, captchaai_key)
常问问题
ScrapingBee 更适合初学者吗?
是的。 ScrapingBee 在一次 API 调用中处理代理、渲染和基本验证码。 CaptchaAI 需要更多设置,但可以为您提供更多控制权并降低规模成本。
我以后可以从 ScrapingBee 切换到 CaptchaAI 吗?
是的。从 ScrapingBee 开始进行原型设计,然后在数量证明开发工作合理时使用 CaptchaAI 构建您自己的基础设施。
哪个更快?
CaptchaAI 求解通常更快,因为您直接控制浏览器。 ScrapingBee 增加了其代理和渲染基础设施的延迟。
相关指南
构建灵活的抓取——以 CaptchaAI 开头.