Install
openclaw skills install @thcjp/desktop-autopilot桌面自动驾驶为 AI Agent 提供基于视觉的智能 GUI 自动化能力。它不依赖固定坐标,而是通过图像识别、OCR 文本定位、智能等待元素出现来操控界面,内置工作流编排、录制回放、DPI 自适应与多显示器支持,让自动化脚本像人一样"看着屏幕操作"。 核心能力:视觉元素定位(图像匹配+OCR)、智能等待(等元素出...
openclaw skills install @thcjp/desktop-autopilot让 AI Agent 像人一样"看着屏幕操作",而不是盲点坐标。本技能解决五个核心痛点:坐标漂移(DPI 缩放、窗口移动导致固定坐标失效)、时机不对(元素没加载就点击)、识别率低(原始 locateOnScreen 效果差)、操作不可逆(点错了无法回退)、流程难复用(每次重写脚本).
本技能聚焦 GUI 层自动化,与系统控制器(系统层)明确分工:
| 本技能负责 | 系统控制器负责 |
|---|---|
| 鼠标点击与移动 | 进程/服务管理 |
| 键盘输入与快捷键 | 文件系统操作 |
| 屏幕截图与图像识别 | 环境变量/注册表 |
| 窗口管理(GUI 层) | 计划任务(系统级) |
| GUI 工作流编排 | 系统资源监控 |
铁律:优先用"找图/找字"定位元素,最后才用固定坐标。坐标会因 DPI、窗口位置、分辨率而漂移,图像识别不会.
| 参数名 | 类型 | 必填 | 说明 |
|---|---|---|---|
| input | string | 是 | 桌面自动驾驶处理的输入数据或指令 |
| options | object | 否 | 附加配置选项,如模式选择、格式偏好等 |
| callback_url | string | 否 | 异步处理完成后的回调通知URL |
dc.click(500, 300)
location = dc.find_on_screen("submit_button.png")
if location:
dc.click_center(location)
location = dc.find_text("提交")
if location:
dc.click_center(location)
pip install pyautogui pillow opencv-python pygetwindow pytesseract
```bash
# 在此执行相关操作
echo "操作完成"
```python
from desktop_autopilot import Autopilot
ap = Autopilot(failsafe=True, dpi_aware=True)
ap.wait_for_image("login_button.png", timeout=10)
ap.click_image("login_button.png")
ap.wait_for_image("username_field.png", timeout=5)
ap.click_image("username_field.png")
ap.type_text("john@example.com")
ap.screenshot("after_login.png")
原始方案用 time.sleep(2) 硬等,慢且不可靠。本技能提供智能等待:
ap.wait_for_image(
"submit_button.png",
timeout=10, # 最长等 10 秒
interval=0.5, # 每 0.5 秒检查一次
confidence=0.8 # 匹配置信度
)
```bash
# 在此执行相关操作
echo "操作完成"
```python
ap.wait_for_text("登录成功", timeout=10)
```bash
# 在此执行相关操作
echo "操作完成"
```python
ap.wait_for_image_gone("loading_spinner.png", timeout=30)
```bash
# 在此执行相关操作
echo "操作完成"
```python
ap.wait_for_color(500, 300, (0, 200, 0), timeout=10)
```bash
# 在此执行相关操作
echo "操作完成"
```python
ap.wait_any(
lambda: ap.find_image("success.png"),
lambda: ap.find_image("error.png"),
timeout=15
)
原始 locateOnScreen 只做单尺度匹配,DPI 变化就找不到。本技能做多尺度:
location = ap.find_image(
"button.png",
confidence=0.8,
multiscale=True, # 多尺度匹配(抗 DPI)
grayscale=True # 灰度匹配(加速)
)
```bash
# 在此执行相关操作
echo "操作完成"
```python
location = ap.find_text("提交订单")
if location:
ap.click_center(location)
```bash
# 在此执行相关操作
echo "操作完成"
```python
buttons = ap.find_all_images("delete_icon.png")
for btn in buttons:
ap.click_center(btn)
```bash
# 在此执行相关操作
echo "操作完成"
```python
ap.click_image("save_button.png", confidence=0.85)
```bash
# 在此执行相关操作
echo "操作完成"
```python
def click_center(self, location):
"""location 是 (x, y, w, h),点击中心点"""
x, y, w, h = location
self.click(x + w//2, y + h//2)
Windows DPI 缩放(125%/150%)是坐标漂移的首要原因。本技能自动处理:
ap = Autopilot(dpi_aware=True)
scale = ap.get_dpi_scale() # 返回 1.0 / 1.25 / 1.5 等
print(f"当前 DPI 缩放: {scale*100}%")
```bash
# 在此执行相关操作
echo "操作完成"
```python
ap.move_mouse(x, y, duration=0, smooth=True) # 移动到绝对坐标
ap.move_relative(dx, dy) # 相对移动
ap.click(x, y, button='left', clicks=1) # 点击
ap.click(button='right') # 右键
ap.double_click(x, y) # 双击
ap.drag(x1, y1, x2, y2, duration=0.5) # 拖拽
ap.scroll(-5) # 滚动(负=向下)
ap.get_mouse_position() # 获取当前位置
```bash
# 在此执行相关操作
echo "操作完成"
```python
ap.type_text("Hello", interval=0, wpm=None) # 输入文本
ap.press('enter') # 单键
ap.press('tab', presses=3) # 多次按键
ap.hotkey('ctrl', 'c') # 快捷键
ap.key_down('shift') # 按住
ap.key_up('shift') # 释放
| 类别 | 键名 |
|---|---|
| 字母数字 | 'a'-'z', '0'-'9' |
| 功能键 | 'f1'-'f24' |
| 特殊键 | enter/esc/space/tab/backspace/delete/home/end/pageup/pagedown |
| 方向键 | up/down/left/right |
| 修饰键 | ctrl/shift/alt/win/cmd |
| 标点 | ./,/?/!/;/:/[/]/{/}/(/)/+/-/*///= |
ap.screenshot() # 全屏截图,返回 Image
ap.screenshot(region=(x,y,w,h)) # 区域截图
ap.screenshot(filename="cap.png") # 保存到文件
ap.get_pixel_color(x, y) # 取色 (r,g,b)
ap.get_screen_size() # 屏幕分辨率 (w,h)
```bash
# 在此执行相关操作
echo "操作完成"
```python
ap.get_all_windows() # 列出所有窗口
ap.activate_window("Chrome") # 按标题激活
ap.get_active_window() # 当前焦点窗口
ap.minimize_window("Calculator") # 最小化
ap.maximize_window("Calculator") # 最大化
ap.get_window_rect("Chrome") # 窗口位置与大小
把多步操作封装为可重放的工作流:
wf = ap.workflow("fill-form")
wf.step("等待表单加载", lambda: ap.wait_for_image("form.png", timeout=10))
wf.step("填写姓名", lambda: (ap.click_image("name_field.png"), ap.type_text("张三")))
wf.step("填写邮箱", lambda: (ap.click_image("email_field.png"), ap.type_text("z@x.com")))
wf.step("提交", lambda: ap.click_image("submit.png"))
wf.step("等待成功", lambda: ap.wait_for_text("提交成功", timeout=10), critical=True)
wf.run()
```bash
# 在此执行相关操作
echo "操作完成"
```python
wf = ap.workflow("smart-login")
wf.step("找登录按钮", lambda: ap.find_image("login_btn.png"))
wf.branch(
condition=lambda result: result is not None,
steps=[
("点击登录", lambda: ap.click_image("login_btn.png")),
("输入凭据", lambda: (ap.click_image("user.png"), ap.type_text("john")))
],
else_steps=[
("可能已登录,找首页", lambda: ap.wait_for_image("home.png", timeout=5))
]
)
```bash
# 在此执行相关操作
echo "操作完成"
```python
wf.save("workflows/fill-form.json")
wf2 = ap.load_workflow("workflows/fill-form.json")
wf2.run()
手动操作一次,录制后无限回放:
ap.record_start("data-entry")
ap.record_stop()
ap.playback("data-entry", verify=True)
危险操作前自动截图,出错可参照:
ap.snapshot("before-form-submit") # 截图存档
ap.click_image("submit.png")
if not ap.wait_for_text("成功", timeout=5):
ap.show_snapshot("before-form-submit") # 展示操作前状态
ap.alert("提交可能失败,请检查")
```bash
# 在此执行相关操作
echo "操作完成"
```python
ap = Autopilot(require_approval=True)
ap.click(500, 300) # 弹窗确认:"允许点击 (500,300)? [y/n]"
鼠标移到屏幕任一角落立即中止所有自动化:
ap = Autopilot(failsafe=True)
所有操作自动记录到 $HOME/.skill-platform/autopilot/logs/:
2026-07-18T09:00:00Z | click_image | submit.png | SUCCESS | (520, 340)
2026-07-18T09:00:02Z | type_text | john@example.com | SUCCESS
2026-07-18T09:00:05Z | wait_for_text | 提交成功 | TIMEOUT | 等待10秒未出现
```bash
# 在此执行相关操作
echo "操作完成"
```python
ap = Autopilot(dpi_aware=True)
ap.snapshot("before")
ap.wait_for_image("name_field.png", timeout=10)
ap.type_text("张三")
ap.press('tab')
ap.type_text("zhang@example.com")
ap.press('tab')
ap.type_text("13800138000")
ap.click_image("submit.png")
ap.wait_for_text("提交成功", timeout=10) or ap.show_snapshot("before")
```bash
# 在此执行相关操作
echo "操作完成"
```python
ap.activate_window("Excel")
ap.hotkey('ctrl', 'c') # 假设已选中
ap.activate_window("CRM")
ap.wait_for_image("crm_input.png", timeout=10)
ap.click_image("crm_input.png")
ap.hotkey('ctrl', 'v')
ap.click_image("save.png")
```bash
# 在此执行相关操作
echo "操作完成"
```python
wf = ap.workflow("login-test")
wf.step("打开登录页", open_login_page)
wf.step("输入凭据", enter_credentials, critical=True)
wf.step("提交", click_submit)
wf.step("验证首页", lambda: ap.png", timeout=10), critical=True)
result = wf.run()
print("测试结果:", "PASS" if result.success else "FAIL")
```bash
# 在此执行相关操作
echo "操作完成"
```python
ap.key_down('ctrl')
for file_pos in [(100, 200), (100, 250), (100, 300)]:
ap.click(*file_pos)
ap.key_up('ctrl')
ap.hotkey('ctrl', 'c')
ap.activate_window("目标文件夹")
ap.hotkey('ctrl', 'v')
| 风险项 | 等级 | 防护措施 | 验证方法 |
|---|---|---|---|
| API密钥泄露 | 高 | 通过环境变量配置,禁止硬编码 | 定期检查代码和配置文件 |
| 命令执行风险 | 高 | 仅执行白名单命令,避免拼接用户输入 | 使用沙箱环境测试 |
| 网络通信安全 | 中 | 使用HTTPS协议,验证SSL证书 | 定期检查证书有效期 |
| 敏感数据暴露 | 高 | 输出结果中不包含密钥、令牌等敏感信息 | 日志脱敏审查 |
| 未授权访问 | 中 | 限制访问权限,实施认证机制 | 定期审计访问日志 |
Q:图像识别找不到元素怎么办?
A:① 提高置信度容差 confidence=0.7;② 开启 multiscale=True 抗 DPI;③ 改用 OCR find_text;④ 检查截图模板是否过期(UI 改版后需更新模板).
Q:DPI 缩放导致坐标偏移?
A:用 dpi_aware=True 初始化,本技能自动校正。或优先用图像/文字定位,避免硬坐标.
Q:多显示器负坐标怎么处理?
A:副显示器在主显示器左侧/上方时坐标为负。get_screen_size() 只返回主屏,用 get_all_monitors() 获取全部。图像定位不受影响(全屏搜索).
Q:某些应用屏蔽了模拟输入?
A:游戏和部分安全应用(如银行 U 盾)会屏蔽 SendInput。可尝试以管理员权限运行,或改用应用本身的 API/CLI.
Q:录制回放可靠吗?
A:verify=True 时每步回放前截图校验,UI 变化会暂停等人工介入。纯坐标回放不可靠,建议结合视觉校验.
Q:和系统控制器怎么配合?
A:本技能管 GUI 操作(点击、输入、截图),系统控制器管系统操作(进程、文件、服务)。如"启动应用"用系统控制器,"在应用里填表"用本技能.
| 症状 | 可能原因 | 处置 |
|---|---|---|
| 图像找不到 | DPI 缩放/UI 改版 | multiscale=True,更新模板图 |
| 坐标点击偏移 | DPI 未校正 | dpi_aware=True |
| 键盘输入无效 | 目标窗口失焦 | 先 activate_window 再输入 |
| 操作过快出错 | 元素未加载 | 用 wait_for_image 替代 sleep |
| Failsafe 误触发 | 鼠标靠近角落 | 调大角落容差或关闭(慎用) |
| OCR 识别差 | Tesseract 未装/语言包缺 | 安装 Tesseract + 中文语言包 |
| 多显示器坐标乱 | 副屏负坐标 | 用图像定位避免坐标问题 |
grayscale=True 提速 3 倍,多数场景够用.find_image(region=(x,y,w,h)) 只搜指定区域,大幅加速.wait_for_image 找到立即返回,不硬等满 timeout.| 依赖项 | 类型 | 是否必需 | 获取方式 |
|---|---|---|---|
| PyAutoGUI | Python 包 | 必需 | pip install pyautogui |
| Pillow | Python 包 | 必需 | pip install pillow |
| OpenCV (opencv-python) | Python 包 | 必需(图像识别) | pip install opencv-python |
| PyGetWindow | Python 包 | 必需(窗口管理) | pip install pygetwindow |
| pytesseract | Python 包 | 可选(OCR) | pip install pytesseract |
| Tesseract OCR | 系统程序 | OCR 必需 | 官方安装 + 中文语言包 |
| NumPy | Python 包 | 推荐(多尺度匹配) | pip install numpy |
| LLM API | API | 必需 | 由 Agent 内置 LLM 提供 |
桌面自动驾驶为 AI Agent 提供基于视觉的智能 GUI 自动化能力 处理: 解析桌面自动驾驶为 AI Agen的输入参数,完成核心逻辑,返回格式化结果. 输出: 返回桌面自动驾驶为 AI Agen的响应数据,附带状态标识与运行日志.
input_params进行配置,支持创建/查询/导出操作它不依赖固定坐标,而是通过图像识别、OCR 文本定位、智能等待元素出现来操控界面,内置工作流编排、录制回放、DPI 自适应与多显示器支持,让自动化脚本像人一样"看着屏幕操作" 处理: 解析它不依赖固定坐标的输入参数,完成核心逻辑,返回格式化结果. 输出: 返回它不依赖固定坐标的响应数据,附带状态标识与运行日志.
input_params进行配置,支持创建/查询/导出操作核心能力:视觉元素定位(图像匹配+OCR)、智能等待(等元素出现/消失)、工作流编排(步骤序列+条件分支)、录制回放、DPI 自适应坐标转换、多显示器管理、安全护栏(确认模式+操作日志+回滚快照) 处理: 解析核心能力的输入参数,完成核心逻辑,返回格式化结果. 输出: 返回核心能力的响应数据,附带状态标识与运行日志.
input_params进行配置,支持创建/查询/导出操作适用场景:表单自动填写、数据录入、应用间数据搬运、UI 回归测试、重复性操作自动化、一人公司省人力 处理: 解析适用场景的输入参数,完成核心逻辑,返回格式化结果. 输出: 返回适用场景的响应数据,附带状态标识与运行日志.
input_params进行配置,支持创建/查询/导出操作定位为"自动驾驶层",与系统控制器(系统层进程/文件)明确分工 处理: 解析定位为"自动驾驶层"的输入参数,完成核心逻辑,返回格式化结果. 输出: 返回定位为"自动驾驶层"的响应数据,附带状态标识与运行日志.
input_params进行配置,支持创建/查询/导出操作
技术参数:使用input_params和output_format参数控制执行行为,支持json/text/csv输出格式.
能力覆盖范围:能力范围包括以下关键词:智能桌面、视觉识别定位、自适应不迷路、Use、when、模型调用、智能对话、LLM、应用时使用、不适用于需要、确定性的关键决策等。这些关键词对应description中声明的使用场景,均已在上述能力点中提供对应的操作支持.ap = Autopilot(dpi_aware=True)
ap.snapshot("before")
ap.png", timeout=10)
ap.type_text("张三")
ap.press('tab')
ap.type_text("13800138000")
ap.click_image("submit.png")
ap.show_snapshot("before")
```bash
# 在此执行相关操作
echo "操作完成"
```python
# 本技能的核心实现逻辑
# 请参考上方使用说明进行配置和调用
result = "implementation_ready"
```bash
# 在此执行相关操作
echo "操作完成"
```bash
pip install pyautogui pillow opencv-python pygetwindow pytesseract
| 操作场景 | 手动耗时 | 自动化耗时 | 效率提升 |
|---|---|---|---|
| 文件解析与提取 | 5-10分钟/个 | <5秒/个 | 60-120x |
| 批量文件处理(100个) | 8-16小时 | <5分钟 | 96-192x |
| API调用与响应解析 | 2-3分钟/次 | <1秒/次 | 120-180x |
| 多接口数据聚合 | 15-30分钟 | <10秒 | 90-180x |
| 命令执行与结果收集 | 3-5分钟/次 | <2秒/次 | 90-150x |
| 重复任务批量执行 | 因任务而异 | 线性缩减 | 5-50x |
| 错误排查与修复 | 10-30分钟 | <30秒 | 20-60x |
| 对比维度 | 桌面自动驾驶 | 传统手动方式 | 通用脚本工具 |
|---|---|---|---|
| 自动化程度 | 全流程自动 | 完全手动 | 部分自动 |
| 错误处理 | 内置错误恢复 | 依赖人工经验 | 基本try-catch |
| 可复用性 | 参数化配置 | 一次性脚本 | 模板化 |
| 安全合规 | 内置安全检查 | 无安全保障 | 无安全保障 |
| 适用场景 | 智能桌面 GUI 自动化,视觉识别定位、智能等待、工作流编排,DPI 自适应不迷 | 通用场景 | 通用场景 |
A2: 是的,部分功能需要配置对应平台的API Key。请在依赖说明章节查看具体要求,并通过环境变量安全配置。
A3: 检查命令参数是否正确,确认运行环境支持exec能力。如遇权限问题,请参照错误处理章节排查。