| name | image-prompt-craft |
| description | 将简短、模糊或互相冲突的视觉需求重写为可直接用于文生图、参考图生成、图片编辑或 PPT 纯底图的高质量提示词。用户要求优化生图 Prompt、统一一组图片风格、生成演示文稿背景,或在实际生图前需要补全构图、材质、光线、色板、文字安全区与保留项时使用;不代替图片模型,也不把普通问答强行改成生图任务。 |
| metadata | {"source":"https://github.com/wuyoscar/GPT-Image2-Skill"} |
Image Prompt Craft
把用户的视觉意图编译成可执行 Prompt。优先提高构图可控性、主体准确度、风格一致性和最终用途适配;不靠堆叠 beautiful、professional、high quality 等空泛词制造“质量感”。
先判断交付模式
只选当前任务需要的模式,并读取对应 Reference:
- 新图、产品图、摄影、插画、海报或单张配图:读取 通用图片 Prompt。
- 参考图生成、局部修改、换背景或风格迁移:读取 图片编辑与参考一致性。
- PPT、Keynote、演示文稿的底图、母版背景或一组页面背景:读取 PPT 底图 Prompt;若用户还要求整套统一,继续读取 系列一致性。
- 多张普通图片需要同一角色、产品、世界观或品牌风格:读取通用图片 Reference 和系列一致性 Reference。
“PPT 页面图”“PPT 海报页”不一定是底图。若标题、正文、图表仍由 PPT/HTML 排版层添加,则必须走纯底图模式;只有用户明确要求把整页文字烤进图片,才按海报/整页成品处理。
共同工作流
- 从用户原话中锁定不可改写项:主体、动作、数量、关系、用途、比例、文字、品牌要求、参考图职责和明确禁项。缺失信息不会改变核心结果时自行采用合理默认值,不追问。
- 先确定画布和区域分配,再描述主体。Prompt 的信息顺序优先为:
画布与用途 → 构图/留白 → 主体与动作 → 环境和可见细节 → 媒介/镜头 → 材质 → 光线 → 色板 → 一致性/保留项 → 精准禁项。
- 用 5–12 个可见名词和明确空间关系替换空泛形容词。材质、光线、色板分开写;只选一个主媒介或主拍摄语法,避免“摄影 + 水彩 + 3D + 扁平插画”无意混杂。
- 普通场景优先输出一段紧凑自然语言。只有产品渲染、复杂多区画面或多套相互作用的视觉系统,才使用结构化分区;不要为了显得专业而输出冗长 JSON。
- 只保留针对模型高概率错误的短禁项,例如多余肢体、伪品牌、乱码或塑料 CGI 感。不要生成占据主体篇幅的否定词清单。
- 最终 Prompt 默认使用清晰英文;用户要求出现在画面中的原文保持原语言并放入双引号。若调用方或模型明确更适合中文,则可输出中文,但结构与约束不变。
输出要求
- 用户只要求“优化提示词”时,直接给最终 Prompt;必要时附一行关键假设,不输出思维过程。
- 用户要求实际生图时,把最终 Prompt 原样交给当前可用的图片生成或编辑工具;本 Skill 不另建供应商调用方式。
- 用户要求多个方案时,方案之间改变一个有意义的轴,如构图、媒介或光线,不做只换形容词的伪变体。
- 用户提供的信息不足以支持特定品牌、人物身份或精确数据时,不擅自补造。
质量闸门
提交前检查:
- 第一段是否已经说明比例、用途和构图,而不是先堆主体细节?
- 主体、数量、动作和空间关系是否可以被画出来?
- 材质、光线、色板是否具体且互不冲突?
- 是否保留了用户所有硬约束和参考图职责?
- PPT 底图是否无文字、无 UI/图表、具有与实际内容布局匹配的低干扰安全区?
- 系列图片是否在每条独立 Prompt 中重复相同的系列锚点,同时有明确的单图变化?
- 删除任何空泛词后,画面是否仍然清楚?若不清楚,继续补充可见细节。