| name | image-prompt-reverse |
| description | AI图像提示词反推工具。分析用户上传的图片,生成精准的描述性提示词,支持输出多种主流AI绘图模型格式(Stable Diffusion、Midjourney、DALL-E 3、Flux、NijiJourney等),具备IP/品牌识别能力,支持交互式精调。当用户需要"反推图片提示词"、"分析图片生成提示词"、"图片转提示词"、"提取图片描述词"、"生成AI绘图提示词"时触发此技能。 |
Image Prompt Reverse
概述
本技能用于分析用户上传的图片,生成精准、全面的AI绘图提示词。采用系统化分析方法,支持10+种主流AI绘图模型格式输出,具备IP/品牌识别能力,支持交互式精调,帮助用户在不同AI平台上复现类似效果的图像。
核心能力
- 图片深度分析 - 系统化提取图片中的视觉元素,使用分层检查清单确保全面性
- 场景专项识别 - 针对人物、动漫、风景、城市、静物、幻想等场景的专项分析
- 多模型格式输出 - 适配10+种主流AI绘图模型的提示词格式
- 智能提示词生成 - 基于场景类型自动生成最优提示词结构
- 角色与IP识别 - 识别常见动漫角色、明星和知名IP品牌
- 质量词推荐 - 自动推荐正向质量词和反向提示词
- 交互式精调 - 支持用户指定区域重点分析和提示词微调
支持的AI绘图模型
| 模型 | 特点 | 适用场景 |
|---|
| Stable Diffusion | 权重语法,高度可控 | 精细调整、专业创作 |
| Midjourney | 自然语言+参数 | 艺术风格、概念设计 |
| DALL-E 3 | 纯自然语言 | 商业应用、文字理解 |
| Flux | 自然语言+风格词 | 写实人像、高质量输出 |
| NijiJourney | 动漫专用 | 二次元、插画创作 |
| Leonardo.ai | 内置风格预设 | 快速原型、多种风格 |
| InvokeAI | 节点工作流 | 专业工作流、精细控制 |
| Playground AI | 滤镜风格 | 快速生成、风格探索 |
| Ideogram | 文字渲染 | 文字设计、海报创作 |
详细格式规范参见 models.md。
工作流程
快速流程(30秒)
1. 识别场景类型 → 2. 提取主体特征 → 3. 分析光影色彩 → 4. 生成提示词
完整流程
步骤1: 接收图片
确认用户已上传图片。如果用户未上传图片,提示用户提供。
步骤2: 场景类型识别
首先识别图片的场景类型,以确定分析重点:
详细场景识别参见 scene-recognition.md。
步骤3: 主体识别
根据场景类型,进行专项识别:
人物图片:
识别置信度:
| 置信度 | 输出方式 |
|---|
| 高 | 直接说出角色/明星名 |
| 中 | "疑似为XX" |
| 低 | 不猜测,详细描述可见特征 |
步骤4: 深度分析
使用五层分析法系统化分析:
第一层: 整体印象 - 风格、氛围、情绪基调
第二层: 主体内容 - 人物/物体特征、数量、位置
第三层: 环境背景 - 场景、地点、背景元素
第四层: 技术细节 - 光照、视角、构图、景深
第五层: 质量特征 - 分辨率、细节程度、画面质感
分析参考文档:
使用检查清单确保全面性:
分析时必须参照 precision-checklist.md 逐项检查。
步骤5: 验证分析结果
交叉验证规则:
- 性别验证: 必须满足 服装特征 + (发型特征 或 面部特征)
- 风格验证: 必须满足至少2个风格特征一致
- 光照验证: 阴影方向 + 高光位置 + 光源方向必须一致
详细验证方法参见 analysis-method.md。
步骤6: 生成提示词
基于场景类型选择模板:
根据识别的场景类型,使用 prompt-templates.md 中的对应模板。
提示词生成原则:
[主体] → [特征] → [环境] → [光照] → [风格] → [技术] → [质量]
- 具体优于抽象: "flowing silver hair" > "nice hair"
- 可量化优于模糊: "35mm lens" > "normal lens"
- 按重要性排序,核心主体权重最高
权重分配策略:
| 元素类型 | SD权重 | MJ权重 | 说明 |
|---|
| 核心主体 | 1.3-1.5 | ::3-5 | 最重要的识别特征 |
| 关键特征 | 1.2-1.3 | ::2-3 | 重要的外貌/特征描述 |
| 风格词 | 1.1-1.2 | ::1-2 | 艺术风格修饰 |
| 环境词 | 0.9-1.1 | ::0.5-1 | 背景环境描述 |
| 质量词 | 1.1-1.3 | 自然融入 | 质量增强词 |
步骤7: 模型适配输出
询问用户需要哪些模型的提示词格式,或默认输出以下常用模型:
| 模型 | 特点 |
|---|
| Stable Diffusion | 权重语法,需质量词 |
| Midjourney | 参数语法,自然描述 |
| DALL-E 3 | 纯自然语言描述 |
| Flux | 自然语言+风格词 |
| NijiJourney | 动漫风格专用 |
自动适配规则:
- SD → Midjourney: 移除权重语法,保留核心描述,添加参数
- SD → DALL-E 3: 展开为完整句子,添加连接词,详细描述
- SD → Flux: 简化权重,保留风格词,自然语言为主
- SD → NijiJourney: 添加--niji参数,优化动漫描述
详细格式规范参见 models.md。
步骤8: 输出质量词
自动生成配套的质量增强词和反向提示词。参见 quality-words.md。
步骤9: 交互式精调(可选)
初始提示词生成后,支持用户进行交互式精调:
精调选项:
- 区域指定分析: 用户指定图片中的特定区域重点分析
- 元素精调: 调整特定元素的描述方式
- 风格微调: 调整整体风格方向
- 权重调整: 修改元素权重分配
- 格式优化: 针对特定模型优化输出格式
详细精调方法参见 interactive-refinement.md。
输出格式
标准输出模板
## 📷 图片分析结果
### 整体描述
[一句话概括图片内容]
### 场景类型
[识别的场景类型]
### 详细分析
- **主体**: [主体描述]
- **角色/IP**: [识别到的角色名/明星名/IP品牌,或"未识别到"]
- **风格**: [艺术风格]
- **光照**: [光照类型]
- **视角**: [视角构图]
- **氛围**: [情绪氛围]
---
## 🎨 提示词输出
### Stable Diffusion
**正向提示词:**
[SD格式提示词]
**反向提示词:**
[反向提示词]
### Midjourney
[Midjourney格式提示词]
### DALL-E 3
[自然语言描述]
### Flux
[Flux格式提示词]
### NijiJourney
[NijiJourney格式提示词]
---
## ✨ 质量词推荐
### 正向质量词
[推荐的质量增强词]
### 反向提示词模板
[通用反向提示词]
提示词编写原则
精准描述
- 具体优于抽象: 使用"flowing silver hair"而非"nice hair"
- 可量化优于模糊: 使用"35mm lens"而非"normal lens"
- 专业术语: 使用"chiaroscuro lighting"而非"dramatic lighting"
- 避免主观: 不描述"beautiful",而是描述"symmetrical facial features"
长度建议
| 模型 | 推荐长度 |
|---|
| Stable Diffusion | 50-150 tokens |
| Midjourney | 30-80 words |
| DALL-E 3 | 100-400 words |
| Flux | 50-150 words |
| NijiJourney | 30-80 words |
不确定性处理
当无法确定某些特征时:
- 性别不确定: 使用"a person"或"androgynous appearance"
- 年龄不确定: 使用"young adult"
- 细节不清: 标注"细节模糊,可能为..."
- 遮挡严重: 标注"部分被遮挡,可见..."
常见错误预防
性别误认预防
高风险场景: 动漫风格人物、中性服装、背影/侧影
预防措施:
- 优先查看服装(裙子/西装等决定性特征)
- 多重特征交叉验证(服装+发型+配饰)
- 不确定时使用中性描述("a person")
详细指南参见 gender-identification.md。
风格误判预防
易混淆风格: 3D渲染vs照片写实、油画vs数字绘画、动漫vs卡通
预防措施:
- 查看纹理细节(笔触、像素、光滑度)
- 检查边缘处理方式
- 观察光影的物理准确性
详细指南参见 art-styles.md。
参考资源快速索引
按分析阶段
按视觉元素
按专业领域
辅助功能