Install
openclaw skills install @chenjy1988/visionImage analysis using Google Gemini vision models. Use when user needs to: (1) Describe what's in an image, (2) Extract text from images (OCR), (3) Analyze visual content, (4) Compare images, (5) Answer questions about images. Supports JPG, PNG, GIF, WebP formats.
openclaw skills install @chenjy1988/vision模型本身看不了图片时(用户发截图/报错图/UI 图/设计稿),用本项目脚本把图片 交给 Google Vertex AI 视觉模型(Gemini),把文字描述/分析结果带回对话。
python3 ~/.claude/skills/vision/scripts/see.py <图片路径或URL> "<要问的问题>"
例:
python3 ~/.claude/skills/vision/scripts/see.py shot.png "这是游戏棋盘截图,描述你看到的内容,棋盘边缘是否有虚空/空洞?"
GOOGLE_API_KEY(gen-image 工具链同款,已在用)GOOGLE_CLOUD_PROJECT(Vertex project id)VISION_MODEL:默认 gemini-2.5-flashVISION_LOCATION:默认 global无需额外安装(纯标准库 urllib + base64;图片用 PNG 重编码,不依赖 pillow 时可跳过重编码)。