Install
openclaw skills install @lilei0311/pixel-gaze让AI像人一样分层看图,不再扫一眼就下结论。4层视觉理解法:整体扫视→识别精度敏感区→专门细看关键细节→如实输出。解决AI看图时漏读数字、错认状态、忽视小字等常见问题。当用户要求分析图片、识别图中内容、读取图中文字/数字、对比图片细节时触发。
openclaw skills install @lilei0311/pixel-gazeAI具备识别图中文字和细节的能力,但一次性扫视容易漏掉关键的小字、数字或状态。本技能通过分层处理机制,让AI像人类阅读一样逐层深入理解图片,而不是"看一眼就猜"。
每次分析图片时,严格按以下4层执行,不得跳层。
先建立对图片的整体认知:
这一步不要求读清所有文字细节。 重点是建立全局地图。
根据第一层的整体认知,判断哪些区域值得细看——这些地方读错会导致后续理解出错:
像侦探一样标记出"如果看错这里,整个回答就废了"的区域。
不要满足于第一层扫视时对这些区域的印象。像人类"凑近看清楚"一样:
本技能的4层流程适用于所有需要从图片中获取精确信息的场景。但并非所有图片都需要同等深度的处理:
| 场景 | 处理方式 |
|---|---|
| 需要从图中读取精确数字/文字/状态 | 必须完整走4层 |
| Agent自己生成的产出物(代码渲染截图、UI页面、前端页面) | 必须完整走4层,禁止因为"看着还行"就跳过 |
| 背景氛围图、纯装饰图、无精度诉求的展示图 | 第一层扫视即可,按需进入第二层 |
特别警告:判断"这张图是否简单"这件事本身,恰恰是"扫一眼就下结论"的行为。在Agent前端自审场景中尤其危险——你很容易觉得"页面看着还行"而跳过细查。凡是涉及精度验证的图片,一律不给予快速通道。
本技能是叠加在AI已有视觉能力之上的行为方法论,不替代模型本身的识别能力。它改变的不是"能不能看清",而是"怎么看":
references/ 目录:
case-agent-self-review.md:Agent前端自审场景(主打案例)case-product-label.md:读产品标签场景(经典案例)