图片生成
用文本描述生成 AI 图片,可选参考图,并在 pro 与 flash 模型及各种宽高比之间选择。
用文本描述生成 AI 图片。可在画质更高的 pro 模型和更快更省的 flash 模型之间选择,挑选分辨率与
宽高比,并可选传入参考图进行风格引导。图片以本地文件返回或内联显示。
触发方式
输入 /image-gen 命令,或使用以下任意短语触发:
| 短语 | 语言 |
|---|---|
generate an image / generate image | 英文 |
draw / visualize / create picture | 英文 |
生成图片 / 画一张 | 中文 |
AI图 / 配图 | 中文 |
使用前请先安装 ListenHub Skills — 参见快速开始。
快速示例
生成图片:赛博朋克城市夜景,16:9,2KAI 会逐个问题收集你的偏好,汇总后请你确认,然后生成图片。
参数
| 参数 | 选项 | 默认值 |
|---|---|---|
| 模型 | 🍌 pro(gemini-3-pro-image,画质更高,推荐)、⚡️ flash(gemini-3.1-flash-image,更快更省,可解锁极端宽高比) | — |
| 分辨率 | 1K、2K(推荐)、4K | — |
| 宽高比 | 16:9、1:1、9:16、2:3、3:2、3:4、4:3、21:9;flash 额外支持 1:4、4:1、1:8、8:1 | — |
| 参考图 | 最多 5 张,支持本地文件或图片 URL | 无 |
选择模型
两个模型都是 Google Gemini 图片模型。根据画质与速度的取舍,以及你需要的宽高比来选择。
| 模型 | 模型 ID | 适用场景 |
|---|---|---|
🍌 pro | gemini-3-pro-image | 追求最高画质和细节。推荐的默认选项。 |
⚡️ flash | gemini-3.1-flash-image | 追求更快、更省的生成,或需要极端宽高比(1:4、4:1、1:8、8:1)。 |
四种极端宽高比 — 1:4(窄竖图)、4:1(宽横图)、1:8(极端竖图)和 8:1(全景)— 仅 flash
模型支持。八种标准宽高比两个模型都支持。
请勿写死积分消耗 — 它取决于模型、分辨率和账户。生成前如需查看费用,请查阅
estimate-credits 接口。
提示词写法
好的提示词应包含以下要素:
- 主体 — 图片中有什么
- 风格 — 艺术风格或视觉处理方式
- 构图 — 元素的排列方式
- 光影/氛围 — 氛围和时间段
- 画质 — 细节程度和渲染质量
示例
基础:
一只猫坐在窗台上更好:
a fluffy orange tabby cat sitting on a sunny windowsill, warm afternoon light, cozy interior, highly detailed, photorealistic风格关键词
| 风格 | 关键词 |
|---|---|
| 写实 | photorealistic, highly detailed, 8K, professional photography |
| 赛博朋克 | neon lights, futuristic, dystopian, rain-slicked streets |
| 水墨画 | Chinese ink painting, traditional art style, brush strokes |
| 水彩 | watercolor painting, soft edges, flowing colors |
| 动漫 | anime style, Japanese animation, cel shading |
| 极简 | minimalist, clean lines, simple composition, white space |
提示词请使用英文 — 图片模型基于英文描述训练。如果你用中文描述,AI 会自动翻译。
提示词增强
AI 默认原样传递你的提示词。它只在以下情况下才会主动提出增强提示词:
- 提示词非常短(仅几个词),且
- 你没有要求逐字生成。
当你接受增强时,AI 会补充风格、光影和构图细节,并在提交前展示扩写后的提示词。例如,"cyberpunk" 会扩写为 "neon lights, futuristic, dystopian, rain-slicked streets"。
对于已经很长、详尽或结构化的提示词,AI 绝不会改写 — 它会把你当作有经验的用户。当你说类似"完全 按这个提示词"时,它也会原封不动地保留提示词。
参考图
参考图引导 AI 的风格,而非内容。你的提示词仍然控制图片中出现的内容。一次请求最多可提供 5 张 参考图,本地文件和 URL 可混用。
支持格式:jpg、png、webp、gif。单文件最大 10 MB。
使用本地文件
该技能直接接受本地文件路径。在 AI 询问参考图时提供路径(例如 ./sketch.png)即可 — 它会为你上传
文件,无需图床。
使用图片 URL
- 将参考图上传到图床(imgbb.com、sm.ms、postimages.org)
- 复制图片直链(以
.jpg、.png、.webp或.gif结尾) - 在 AI 询问参考图时提供 URL
你可以在同一次请求中混用本地文件和 URL — 例如一张本地草图加一张托管的照片。
使用 Base64 编码数据(API)
通过图片生成 API 调用时,还可以使用 inlineData
字段直接传入 base64 编码的图片数据,无需上传图床。适用于已经在内存中持有图片的程序化场景。
每张参考图必须且仅能使用 fileData(URL)或 inlineData(base64)之一。请求格式和代码示例请参阅
API 参考文档。
输出
输出方式取决于配置时设置的 outputMode:
inline(默认) — 图片直接显示在对话中download— 保存到当前项目的.listenhub/image-gen/YYYY-MM-DD-{id}/目录下both— 内联显示并同时保存到本地
如需更改输出方式,在 AI 显示当前配置时说"重新配置"即可。
API 参考
接口详情、请求参数、provider/model 矩阵和代码示例请查看图片生成 API 参考文档。