美国的县级地籍系统、州政府地理空间门户,查询地块边界、分区规划或洪泛区数据前通常会弹出图片或 OCR 验证码。这些系统大多是老技术栈,换验证码要走长周期审批,所以老验证码一直留着。批量抓取地块、分区、评估值数据前,先处理这道验证码。
GIS 门户常见的验证码类型
| 门户类型 | 验证码类型 | 触发条件 |
|---|---|---|
| 县级 GIS / 地籍系统 | 图片文字验证码 | 地块搜索查询 |
| 州政府地理空间门户 | 自定义验证码 | 数据下载请求 |
| 美国地质调查局(USGS)数据门户 | reCAPTCHA v2 | 批量数据访问 |
| 市政分区图 | 图片验证码 | 重复查询地块 |
| 环境数据库 | 数学验证码 | 报告生成 |
| 洪泛区查询 | 图片文字验证码 | 地址查询 |
提醒一下:表中 USGS 的 reCAPTCHA v2 由 Google 托管脚本,国内网络访问常不稳定,属连通性问题,与识别能力无关。国内政务系统更常见 GeeTest(极验),CaptchaAI 目前支持 GeeTest v3。
Python 实战:地块查询与批量提取
GISDataExtractor 类封装了地块查询、地址搜索和批量提取,验证码识别统一走内部 _solve_captcha 方法。
import requests
import base64
import time
import re
class GISDataExtractor:
def __init__(self, api_key):
self.api_key = api_key
self.session = requests.Session()
self.session.headers.update({
"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36"
})
def lookup_parcel(self, portal_url, parcel_id):
"""Look up parcel data by ID, solving CAPTCHAs as needed."""
response = self.session.get(
f"{portal_url}/parcel", params={"id": parcel_id}
)
if self._has_image_captcha(response.text):
captcha_url = self._extract_captcha_url(response.text, portal_url)
captcha_text = self._solve_captcha(captcha_url)
# Re-submit with solved CAPTCHA
response = self.session.post(f"{portal_url}/parcel", data={
"id": parcel_id,
"captcha": captcha_text,
**self._extract_hidden_fields(response.text)
})
return self._parse_parcel_data(response.text)
def search_by_address(self, portal_url, address):
"""Search GIS records by street address."""
response = self.session.get(
f"{portal_url}/search", params={"address": address}
)
if self._has_image_captcha(response.text):
captcha_url = self._extract_captcha_url(response.text, portal_url)
captcha_text = self._solve_captcha(captcha_url)
response = self.session.post(f"{portal_url}/search", data={
"address": address,
"captcha": captcha_text,
**self._extract_hidden_fields(response.text)
})
return self._parse_search_results(response.text)
def bulk_extract(self, portal_url, parcel_ids, delay=3):
"""Extract data for multiple parcels with rate limiting."""
results = {}
for parcel_id in parcel_ids:
try:
results[parcel_id] = self.lookup_parcel(portal_url, parcel_id)
except Exception as e:
results[parcel_id] = {"error": str(e)}
time.sleep(delay)
return results
def _has_image_captcha(self, html):
return bool(re.search(
r'captcha|verification.?image|security.?code',
html, re.IGNORECASE
))
def _extract_captcha_url(self, html, base_url):
from bs4 import BeautifulSoup
from urllib.parse import urljoin
soup = BeautifulSoup(html, "html.parser")
img = (
soup.find("img", attrs={"src": lambda s: s and "captcha" in s.lower()}) or
soup.find("img", {"id": re.compile(r"captcha", re.I)}) or
soup.find("img", {"class": re.compile(r"captcha", re.I)})
)
if img and img.get("src"):
return urljoin(base_url, img["src"])
raise ValueError("CAPTCHA image not found")
def _solve_captcha(self, captcha_url):
"""Download and solve image CAPTCHA."""
img_response = self.session.get(captcha_url)
img_base64 = base64.b64encode(img_response.content).decode("utf-8")
resp = requests.post("https://ocr.captchaai.com/in.php", data={
"key": self.api_key,
"method": "base64",
"body": img_base64,
"json": 1
})
task_id = resp.json()["request"]
for _ in range(30):
time.sleep(3)
result = requests.get("https://ocr.captchaai.com/res.php", params={
"key": self.api_key,
"action": "get",
"id": task_id,
"json": 1
})
data = result.json()
if data["status"] == 1:
return data["request"]
raise TimeoutError("CAPTCHA solve timed out")
def _extract_hidden_fields(self, html):
from bs4 import BeautifulSoup
soup = BeautifulSoup(html, "html.parser")
fields = {}
for inp in soup.select("input[type='hidden']"):
name = inp.get("name")
if name:
fields[name] = inp.get("value", "")
return fields
def _parse_parcel_data(self, html):
from bs4 import BeautifulSoup
soup = BeautifulSoup(html, "html.parser")
def text_or_none(node):
return node.text.strip() if node and node.text else None
return {
"parcel_id": text_or_none(soup.select_one(".parcel-id, #parcelId")),
"owner": text_or_none(soup.select_one(".owner, .owner-name")),
"address": text_or_none(soup.select_one(".address, .situs")),
"zoning": text_or_none(soup.select_one(".zoning, .zone-code")),
"acreage": text_or_none(soup.select_one(".acreage, .area")),
"assessed_value": text_or_none(soup.select_one(".assessed, .value")),
"land_use": text_or_none(soup.select_one(".land-use, .use-code"))
}
def _parse_search_results(self, html):
from bs4 import BeautifulSoup
soup = BeautifulSoup(html, "html.parser")
def text_or_none(node):
return node.text.strip() if node and node.text else None
results = []
for row in soup.select(".result-row, tr.parcel"):
results.append({
"parcel_id": text_or_none(row.select_one(".parcel-id")),
"address": text_or_none(row.select_one(".address")),
"owner": text_or_none(row.select_one(".owner"))
})
return results
# Usage
extractor = GISDataExtractor("YOUR_API_KEY")
# Single parcel lookup
parcel = extractor.lookup_parcel(
"https://gis.county.example.gov",
"12-34-567-890"
)
print(f"Owner: {parcel['owner']}, Zoning: {parcel['zoning']}")
# Bulk extraction
parcels = extractor.bulk_extract(
"https://gis.county.example.gov",
["12-34-567-890", "12-34-567-891", "12-34-567-892"]
)
验证码参数怎么配置
method=base64—— 标准图片验证码。numeric=1—— 只含数字时使用。min_len/max_len—— 已知字符数范围时限定长度,如min_len=4、max_len=6。language=0—— 英文 / Latin 字符集。textinstructions—— 自定义说明,用于数学验证码或固定格式代码。
JavaScript 版本:按经纬度坐标批量提取
按经纬度网格遍历区域而非按地块 ID 查询时,可以用 GISExtractor 类,验证码识别逻辑与 Python 版本一致。
class GISExtractor {
constructor(apiKey) {
this.apiKey = apiKey;
}
async extractByCoordinates(portalUrl, lat, lng) {
const url = `${portalUrl}/identify?lat=${lat}&lng=${lng}`;
const response = await fetch(url);
const html = await response.text();
if (this.hasCaptcha(html)) {
return this.solveAndExtract(portalUrl, html, { lat, lng });
}
return this.parseGISData(html);
}
async extractRegion(portalUrl, bounds, gridSize = 0.01) {
const results = [];
const { north, south, east, west } = bounds;
for (let lat = south; lat <= north; lat += gridSize) {
for (let lng = west; lng <= east; lng += gridSize) {
try {
const data = await this.extractByCoordinates(portalUrl, lat, lng);
if (data.parcelId) results.push(data);
} catch (error) {
console.error(`Failed at ${lat},${lng}: ${error.message}`);
}
// Rate limit
await new Promise(r => setTimeout(r, 2000));
}
}
return results;
}
hasCaptcha(html) {
return /captcha|verification.?image|security.?code/i.test(html);
}
async solveAndExtract(portalUrl, html, params) {
const imgMatch = html.match(/src="([^"]*captcha[^"]*)"/i);
if (!imgMatch) throw new Error('CAPTCHA image not found');
const imgUrl = new URL(imgMatch[1], portalUrl).href;
const imgResp = await fetch(imgUrl);
const buffer = await imgResp.arrayBuffer();
const base64 = Buffer.from(buffer).toString('base64');
const submitResp = await fetch('https://ocr.captchaai.com/in.php', {
method: 'POST',
body: new URLSearchParams({
key: this.apiKey,
method: 'base64',
body: base64,
json: '1'
})
});
const { request: taskId } = await submitResp.json();
for (let i = 0; i < 30; i++) {
await new Promise(r => setTimeout(r, 3000));
const result = await fetch(
`https://ocr.captchaai.com/res.php?key=${this.apiKey}&action=get&id=${taskId}&json=1`
);
const data = await result.json();
if (data.status === 1) {
const response = await fetch(portalUrl, {
method: 'POST',
body: new URLSearchParams({
...params,
captcha: data.request
})
});
return this.parseGISData(await response.text());
}
}
throw new Error('CAPTCHA solve timed out');
}
parseGISData(html) {
return {
parcelId: html.match(/parcel.?id[^>]*>([^<]+)/i)?.[1]?.trim(),
zoning: html.match(/zon(?:e|ing)[^>]*>([^<]+)/i)?.[1]?.trim(),
acreage: html.match(/acreage|area[^>]*>([^<]+)/i)?.[1]?.trim(),
landUse: html.match(/land.?use[^>]*>([^<]+)/i)?.[1]?.trim()
};
}
}
// Usage
const gis = new GISExtractor('YOUR_API_KEY');
// Single coordinate lookup
const data = await gis.extractByCoordinates(
'https://gis.county.example.gov',
34.0522, -118.2437
);
// Extract entire region
const region = await gis.extractRegion('https://gis.county.example.gov', {
north: 34.10, south: 34.00, east: -118.20, west: -118.30
});
批量提取前的检查清单
- 大规模采集前,先确认地图视口、区域过滤条件和分页控件正常。
- 保存标准化坐标请求体和原始响应,方便定位报错步骤。
- 验证码频率突然升高时先暂停批次,别用重试掩盖对端策略变化。
常见故障排查
- 验证码图片损坏:缺会话 cookie,先加载搜索页面再取验证码。
- 识别结果被拒绝:区分大小写,加
case_sensitive=1参数。 - 门户每次返回不同验证码:与 session 绑定,需在同一 session 内下载并识别。
- 通过后没有地块数据:缺隐藏表单字段,提交前先提取所有隐藏 input。
常见问题
GIS 门户为什么还在用老式图片验证码?
政府 GIS 系统大多建在验证码服务商还不成熟的年代,换验证码要走长周期审批,团队缺乏升级动力。国内政务系统也常是如此。
USGS 这类门户用的是 reCAPTCHA v2,国内网络访问会有问题吗?
reCAPTCHA 依赖 Google 托管脚本,国内访问常不稳定,属连通性问题,与识别能力无关。先确认页面能正常加载,再排查识别环节。
不同县的验证码格式都不一样,要怎么处理?
每个县的验证码实现可能不同。用 textinstructions 参数描述具体格式,比如“5 位大写字母”,识别准确率更高。
批量抓取地块数据时,怎么避免触发验证码频率升高?
控制并发和请求间隔,参考上面的检查清单;频率明显上升时先暂停任务,别靠加大重试硬扛。
下一步该看什么
围绕 GIS 验证码处理,继续看:
- CaptchaAI 快速上手:5 分钟解决你的第一个验证码
- 使用 API 解决 reCAPTCHA v2:分步实战指南
- 如何使用 API 解决 Cloudflare Turnstile
- 如何使用 API 解决 GeeTest v3 问题
注册 CaptchaAI 拿 API Key,把政府门户验证码交给它处理,稳定跑通 GIS 数据提取。