| name | sin-vision-colab |
| description | Screen recording + AI vision analysis via direct Gemini REST API. No browser, no Colab MCP, no CDP. Pure REST with 6-model fallback chain for unlimited vision calls. |
| license | Apache-2.0 |
| compatibility | opencode |
| metadata | {"audience":"all-agents","workflow":"screen-vision-analysis","trigger":"screen-record, screenshot, vision-analyze, look-screen","version":"v4-gemini-rest-fallback"} |
A2A-SIN-Vision-Colab Skill (v4 SOTA 2026)
Screen recording + AI vision analysis via direct Gemini REST API with a 6-model fallback chain.
๐ด WHAT DOES NOT WORK (March 2026)
- โ Browser automation (nodriver, AppleScript) for Colab โ Chrome 146+ blocks DevToolsActivePort
- โ Colab MCP Server โ requires open browser tab, not headless
- โ CDP on default Chrome profile โ blocked since Chrome 146
- โ Leaked Gemini API keys โ old key
AIzaSyA1THIC_... is revoked
๐ข ARCHITECTURE (V4 - Direct Gemini REST API)
[Agent] โ look-screen CLI โ [Gemini REST API] โ Vision Analysis
โ โ
screencapture -x base64 inline_data
โ โ
/tmp/screen.png 6-model fallback chain
๐ KEY FEATURES
- โ
KEIN Browser! โ Pure REST, no browser at all
- โ
KEIN Colab MCP! โ Direct Gemini API, no notebook needed
- โ
KEIN CDP! โ No Chrome DevTools Protocol
- โ
6-Model Fallback Chain โ Practically unlimited free-tier calls
- โ
API Key:
AIzaSyCnRoGEoQJBAVssEu6BP1ojSBzIwV5r8_o
๐ FALLBACK CHAIN (Unlimited Free Tier)
| Priority | Model | Free Tier Quota | Purpose |
|---|
| 1 | gemini-2.5-flash | Unlimited RPM, 1M context | Primary vision |
| 2 | gemini-3-flash-preview | 5 RPM, 250K tokens | Backup vision |
| 3 | gemini-3.1-flash-lite-preview | 15 RPM, 250K tokens | Lightweight backup |
| 4 | gemma-3-27b | 30 RPM, 15K context | Fallback vision |
| 5 | gemma-3-12b | 30 RPM, 15K context | Fallback vision |
| 6 | gemma-3-4b | 30 RPM, 15K context | Last resort |
๐ WANN NUTZEN
| Trigger | Aktion |
|---|
| "nimm bildschirm auf" | look-screen --record |
| "analysiere bildschirm" | look-screen --screenshot /tmp/screen.png --describe |
| "was siehst du?" | look-screen --once --screenshot /tmp/screen.png |
| "รผberwache bildschirm" | look-screen --interval 3 |
| "stop aufnahme" | look-screen --stop |
๐ SETUP
1. look-screen CLI ist bereits installiert
look-screen --version
2. API Key konfigurieren (optional)
Der API Key ist hardcoded im Script. รberschreiben via Environment Variable:
export GEMINI_VISION_API_KEY="your-key-here"
3. Verifizieren
look-screen --status
๐ง LOOK-SCREEN CLI
look-screen --status
look-screen --screenshot /tmp/screen.png --describe
look-screen --screenshot /tmp/screen.png --describe --prompt "Ist ein Fehler sichtbar?"
look-screen --interval 3
screencapture -x /tmp/screen.png && look-screen --screenshot /tmp/screen.png --describe
๐ AGENT WORKFLOW
import subprocess
subprocess.run(["screencapture", "-x", "/tmp/screen.png"])
result = subprocess.run(
["look-screen", "--screenshot", "/tmp/screen.png", "--describe"],
capture_output=True, text=True
)
analysis = result.stdout
โ ๏ธ ARCHITECTURAL RULE: NO BROWSER FOR VISION
NIEMALS versuchen, Vision-Analyse รผber Browser, Colab MCP oder CDP zu machen.
Immer look-screen CLI nutzen โ das ruft direkt die Gemini REST API auf.
๐ RESSOURCEN