macOS visual input substitute for text-only agents: local Apple Vision OCR + Accessibility structure -> compact, priority-ranked Visual State for OpenClaw.