소스 정보
- 저장소
- DDDFXYqiming/Agent_Extensions
- 최근 소스 활동
- 2026년 8월 15일 16:50
- 감지된 SKILL.md 언어
- 중국어
- 스타
- 7
- 포크
- 0
설치 방법
기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.
소스 파일 검토
설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.
메뉴
기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.
설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.
SOC 직업 분류 기준
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
직접 명령은 검토 Prompt를 거치지 않습니다. 실행하기 전에 소스를 확인하세요.
npx skills add https://github.com/DDDFXYqiming/Agent_Extensions --skill vision명령은 한 줄로 유지됩니다. 복사하기 전에 가로로 스크롤해 전체 내용을 확인하세요.
로컬 사본을 원하시나요? SkillsMP에서 현재 제공할 수 있는 파일을 다운로드하세요.
SKILL.md 표시 중
Use when user wants to summarize, analyze, or generate notes from a video URL. Converts video content into structured Markdown notes with timestamps, extracted visual frames, native multimodal image observations, and AI summaries. Supports Bilibili, YouTube, Douyin, Kuaishou, and local files.
跨会话长期记忆:读写经验 SOP 与环境事实;管理 pending 候选、溯源、归档/回滚、统计与维护。当任务涉及本机环境、工具配置、以前踩过的坑,或任务完成发现值得沉淀的验证经验时使用。
识别图片内容。当用户发送图片、截图、报错图,或要求分析某张本地图片时使用。优先调用 vision_analyze(本地图片路径)或 vision_clipboard(剪贴板图片)。
| name | vision |
| description | 识别图片内容。当用户发送图片、截图、报错图,或要求分析某张本地图片时使用。先定位图片文件路径,再运行 vision.py 脚本获取文字描述。 |
当主模型不支持直接读取图片时,图片不会进入对话上下文,但用户消息中通常会附带图片的本地路径(形如 C:/Users/.../codex-clipboard-*.png 或附件路径)。
templates/.env.example 为技能目录下的 .env(脚本启动时自动加载,无需额外依赖),填入:
VISION_API_URL:视觉模型 OpenAI 兼容完整接口地址(含路径,如 https://api.example.com/v1/chat/completions)VISION_MODEL:模型名VISION_API_KEY:API Key
也可以直接导出同名环境变量;环境变量优先级高于 .env 文件(便于 CI/容器注入)。python scripts/vision.py --check 自检,确认配置生效。本技能不硬编码任何模型地址、模型名或密钥,全部通过环境变量注入。
从用户消息中找到图片路径;如果路径不明确,先查找最近的剪贴板截图:
Get-ChildItem $env:TEMP\codex-clipboard-*.png | Sort-Object LastWriteTime -Descending | Select-Object -First 3 FullName,Length
运行脚本识别图片:
cd <技能目录>; python scripts/vision.py "<图片绝对路径>" "(可选)具体识图要求"
脚本输出图片的文字描述(可能较长),基于描述回答用户的问题;描述中的重要文字、报错信息要原样转述。
脚本已自动区分“交互终端”和“管道/重定向”:
如果仍出现乱码(例如旧版控制台代码页为 936),先执行下面一行再运行脚本:
[Console]::OutputEncoding = [System.Text.Encoding]::UTF8; $OutputEncoding = [System.Text.Encoding]::UTF8; $env:PYTHONIOENCODING = 'utf-8'
重定向到文件时,输出文件为 UTF-8 编码,请用 Get-Content -Encoding UTF8 读取。
| 场景 | 命令 |
|---|---|
| 一般识图 | vision.py "<图>" |
| 提取所有文字(OCR,保持排版) | vision.py "<图>" --mode ocr |
| 表格/数据截图转 Markdown 表格 | vision.py "<图>" --mode table |
| 代码/日志/报错截图 | vision.py "<图>" --mode code 或 --mode error |
| 小字看不清:先全图定位,再裁局部放大读 | vision.py "<图>" --crop x1,y1,x2,y2 --budget large |
| 多张图对比 / 批量读 | vision.py "a.png" --images "b.png" "c.png" --prompt "对比这两张" |
| 高分辨率细节(4K 截图小字) | vision.py "<图>" --budget large |
| 原图直发(不缩放) | vision.py "<图>" --no-resize |
| 环境自检(配置/PIL/接口) | vision.py --check |
--crop x1,y1,x2,y2 裁出来,配合 --budget large 放大后再读,直到信息足够。--crop 坐标为原图像素坐标(左上角为原点);--save-crop 路径 可把实际发送的裁切图存下来复核。
DSH 的 DeepSeek 适配器是纯文本路由,默认会拒绝图片块,接入需三步:
~/.dsh/skills/vision-skill/(SKILL.md + scripts/ + templates/ + .env),skill-filesystem 会自动发现并注入会话目录。[vision-skill patch] 标记,包升级后需重打):
@deepseek-ai/dsh-host-apiproxy:放开 prompt 与 selectModel 的图片门禁(inputModalities 检查改为 false &&,共 2 处)@deepseek-ai/dsh-llm-deepseek:图片块不再抛 UNSUPPORTED_CONTENT,flattenText 改为序列化成带本地路径的文本占位符,格式:[图片附件 sha256:<hash>,本地路径 <DSH_HOME>/attachments/v1/objects/<h[:2]>/<h>,模型不支持直接读图,请用 vision skill 读取]~/.dsh/vision-patch/reapply-vision-patch.ps1(幂等,含 v1→v2 升级).env 填 VISION_API_URL(OpenAI 兼容完整地址)、VISION_MODEL、VISION_API_KEY;主模型保持纯文本模型即可,图片经占位符路径交给本脚本识别。脚本默认 thinking: disabled(思考关闭)。--crop 只作用于第一张主图。thinking: disabled,识图更快);若模型不支持该参数可删除对应字段,或改为 adaptive 开启。