用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/egbertie/satisficing-lab --skill video-image-file-analysis命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
正在显示 SKILL.md
| name | video-image-file-analysis 多模态视频图片分析专家 |
| description | 图片分析与识别,可分析本地图片、网络图片、视频、文件。适用于 OCR、物体识别、场景理解等。当用户发送图片或要求分析图片时必须使用此技能。 |
支持智谱 GLM-4V 和千问 Qwen-VL 两种视觉模型。
当用户发送图片或要求分析图片时,必须使用此技能,不要使用 PIL、pytesseract 等其他方法。
编辑 skills/image-analysis/scripts/config.json:
{
"default_model": "zhipu",
"zhipu": {
"api_key": "your-zhipu-api-key",
"model": "glm-4.6v-flash"
},
"qwen": {
"api_key": "your-qwen-api-key",
"model": "qwen3-vl-plus"
}
}
API Key 获取:
# 分析本地图片(最常用)
python3 skills/image-analysis/scripts/vision.py analyze --image 图片路径 --prompt "描述图片内容"
# 分析网络图片
python3 skills/image-analysis/scripts/vision.py analyze --image https://example.com/image.jpg --prompt "描述图片"
# 多图对比
python3 skills/image-analysis/scripts/vision.py analyze --image img1.jpg --image img2.jpg --prompt "对比差异"
# 指定模型
python3 skills/image-analysis/scripts/vision.py analyze --image image.jpg --prompt "描述图片" --model qwen
# 开启思考模式(仅智谱,提升准确度)
python3 skills/image-analysis/scripts/vision.py analyze --image image.jpg --prompt "详细分析" --thinking
# 视频分析
python3 skills/image-analysis/scripts/vision.py analyze --video video.mp4 --prompt "总结视频内容"
# JSON 输出
python3 skills/image-analysis/scripts/vision.py analyze --image image.jpg --prompt "描述图片" --json
用户发送图片后,系统下载到本地(如 data/temp/images/xxx.jpg):
# 图片描述
python3 skills/image-analysis/scripts/vision.py analyze --image data/temp/images/xxx.jpg --prompt "描述这张图片的内容"
# OCR 识别
python3 skills/image-analysis/scripts/vision.py analyze --image data/temp/images/xxx.jpg --prompt "提取图片中的所有文字信息"
# 物体定位(开启思考模式)
python3 skills/image-analysis/scripts/vision.py analyze --image data/temp/images/xxx.jpg --prompt "找出物体位置,返回坐标" --thinking
| 场景 | 推荐 |
|---|---|
| 简单描述 | 任意 |
| 复杂推理、物体定位 | 智谱 + --thinking |
| 高精度识别、文档解析 | 千问 |
| 成本敏感 | 智谱(免费) |
在 Coze 聊天里需要把文件、图片、截图、图表、PDF、报告或任何可视化/二进制产物送达用户时使用——本地文件 (你刚生成的) 和群文件 (你从 `coze agent` 拿到群文件路径的) 两种来源都走这个技能。聊天默认纯文本, 生成的文件不会自动送达用户。触发: 用户明说要看 ("把图发我"、"send me the chart"); 隐式产出 (你刚生成 plot.png 用户在等结果); 主动展示 (做完该让用户看到的文件); 群文件转发 (你通过 `coze agent` 命令上传/获取到群文件路径后)。不适用于: 纯文本回答、短代码块、大于 50MB 的本地文件。
仅在 `<coze-context>` 标识为"群聊消息"且任务涉及该群组协作时使用——浏览群消息历史、查询群成员、读写编辑群项目文件、协调群里的多方协作、把协作产出衔接给用户。触发场景: 用户问"上次说啥/这次结论是啥"、"谁在群里/有谁的权限"; 用户让你"看一下/改一下/沉淀到"群文件; 用户让你基于群历史/群文件做产出。在"单聊消息"或与该群协作无关的一般性问答下不要使用。
4-agent AI advisory committee for strategic decisions. Runs CS, Marketing, Finance, and Tech agents in sequence to analyze proposals and deliver a majority-vote recommendation. Trigger: when you need help deciding strategy, prioritization, or whether to build something new.
基于 SOC 职业分类