用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/DDDFXYqiming/Agent_Extensions --skill vision命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
Use when user wants to summarize, analyze, or generate notes from a video URL. Converts video content into structured Markdown notes with timestamps, extracted visual frames, native multimodal image observations, and AI summaries. Supports Bilibili, YouTube, Douyin, Kuaishou, and local files.
跨会话长期记忆:读写经验 SOP 与环境事实;管理 pending 候选、溯源、归档/回滚、统计与维护。当任务涉及本机环境、工具配置、以前踩过的坑,或任务完成发现值得沉淀的验证经验时使用。
识别图片内容。当用户发送图片、截图、报错图,或要求分析某张本地图片时使用。优先调用 vision_analyze(本地图片路径)或 vision_clipboard(剪贴板图片)。
基于 SOC 职业分类
正在显示 SKILL.md
| name | vision |
| description | 识别图片内容。当用户发送图片、截图、报错图,或要求分析某张本地图片时使用。先定位图片文件路径,再运行 vision.py 脚本获取文字描述。 |
当主模型不支持直接读取图片时,图片不会进入对话上下文,但用户消息中通常会附带图片的本地路径(形如 C:/Users/.../codex-clipboard-*.png 或附件路径)。
templates/.env.example 为技能目录下的 .env(脚本启动时自动加载,无需额外依赖),填入:
VISION_API_URL:视觉模型 OpenAI 兼容完整接口地址(含路径,如 https://api.example.com/v1/chat/completions)VISION_MODEL:模型名VISION_API_KEY:API Key
也可以直接导出同名环境变量;环境变量优先级高于 .env 文件(便于 CI/容器注入)。python scripts/vision.py --check 自检,确认配置生效。本技能不硬编码任何模型地址、模型名或密钥,全部通过环境变量注入。
从用户消息中找到图片路径;如果路径不明确,先查找最近的剪贴板截图:
Get-ChildItem $env:TEMP\codex-clipboard-*.png | Sort-Object LastWriteTime -Descending | Select-Object -First 3 FullName,Length
运行脚本识别图片:
cd <技能目录>; python scripts/vision.py "<图片绝对路径>" "(可选)具体识图要求"
脚本输出图片的文字描述(可能较长),基于描述回答用户的问题;描述中的重要文字、报错信息要原样转述。
脚本已自动区分“交互终端”和“管道/重定向”:
如果仍出现乱码(例如旧版控制台代码页为 936),先执行下面一行再运行脚本:
[Console]::OutputEncoding = [System.Text.Encoding]::UTF8; $OutputEncoding = [System.Text.Encoding]::UTF8; $env:PYTHONIOENCODING = 'utf-8'
重定向到文件时,输出文件为 UTF-8 编码,请用 Get-Content -Encoding UTF8 读取。
| 场景 | 命令 |
|---|---|
| 一般识图 | vision.py "<图>" |
| 提取所有文字(OCR,保持排版) | vision.py "<图>" --mode ocr |
| 表格/数据截图转 Markdown 表格 | vision.py "<图>" --mode table |
| 代码/日志/报错截图 | vision.py "<图>" --mode code 或 --mode error |
| 小字看不清:先全图定位,再裁局部放大读 | vision.py "<图>" --crop x1,y1,x2,y2 --budget large |
| 多张图对比 / 批量读 | vision.py "a.png" --images "b.png" "c.png" --prompt "对比这两张" |
| 高分辨率细节(4K 截图小字) | vision.py "<图>" --budget large |
| 原图直发(不缩放) | vision.py "<图>" --no-resize |
| 环境自检(配置/PIL/接口) | vision.py --check |
--crop x1,y1,x2,y2 裁出来,配合 --budget large 放大后再读,直到信息足够。--crop 坐标为原图像素坐标(左上角为原点);--save-crop 路径 可把实际发送的裁切图存下来复核。
DSH 的 DeepSeek 适配器是纯文本路由,默认会拒绝图片块,接入需三步:
~/.dsh/skills/vision-skill/(SKILL.md + scripts/ + templates/ + .env),skill-filesystem 会自动发现并注入会话目录。[vision-skill patch] 标记,包升级后需重打):
@deepseek-ai/dsh-host-apiproxy:放开 prompt 与 selectModel 的图片门禁(inputModalities 检查改为 false &&,共 2 处)@deepseek-ai/dsh-llm-deepseek:图片块不再抛 UNSUPPORTED_CONTENT,flattenText 改为序列化成带本地路径的文本占位符,格式:[图片附件 sha256:<hash>,本地路径 <DSH_HOME>/attachments/v1/objects/<h[:2]>/<h>,模型不支持直接读图,请用 vision skill 读取]~/.dsh/vision-patch/reapply-vision-patch.ps1(幂等,含 v1→v2 升级).env 填 VISION_API_URL(OpenAI 兼容完整地址)、VISION_MODEL、VISION_API_KEY;主模型保持纯文本模型即可,图片经占位符路径交给本脚本识别。脚本默认 thinking: disabled(思考关闭)。--crop 只作用于第一张主图。thinking: disabled,识图更快);若模型不支持该参数可删除对应字段,或改为 adaptive 开启。