ListenHubSkills

图片生成

用文本描述生成 AI 图片,可选参考图,并在 pro 与 flash 模型及各种宽高比之间选择。

用文本描述生成 AI 图片。可在画质更高的 pro 模型和更快更省的 flash 模型之间选择,挑选分辨率与 宽高比,并可选传入参考图进行风格引导。图片以本地文件返回或内联显示。

触发方式

输入 /image-gen 命令,或使用以下任意短语触发:

短语语言
generate an image / generate image英文
draw / visualize / create picture英文
生成图片 / 画一张中文
AI图 / 配图中文

使用前请先安装 ListenHub Skills — 参见快速开始

快速示例

生成图片:赛博朋克城市夜景,16:9,2K

AI 会逐个问题收集你的偏好,汇总后请你确认,然后生成图片。

参数

参数选项默认值
模型🍌 progemini-3-pro-image,画质更高,推荐)、⚡️ flashgemini-3.1-flash-image,更快更省,可解锁极端宽高比)
分辨率1K2K(推荐)、4K
宽高比16:91:19:162:33:23:44:321:9flash 额外支持 1:44:11:88:1
参考图最多 5 张,支持本地文件或图片 URL

选择模型

两个模型都是 Google Gemini 图片模型。根据画质与速度的取舍,以及你需要的宽高比来选择。

模型模型 ID适用场景
🍌 progemini-3-pro-image追求最高画质和细节。推荐的默认选项。
⚡️ flashgemini-3.1-flash-image追求更快、更省的生成,或需要极端宽高比(1:44:11:88:1)。

四种极端宽高比 — 1:4(窄竖图)、4:1(宽横图)、1:8(极端竖图)和 8:1(全景)— flash 模型支持。八种标准宽高比两个模型都支持。

请勿写死积分消耗 — 它取决于模型、分辨率和账户。生成前如需查看费用,请查阅 estimate-credits 接口

提示词写法

好的提示词应包含以下要素:

  1. 主体 — 图片中有什么
  2. 风格 — 艺术风格或视觉处理方式
  3. 构图 — 元素的排列方式
  4. 光影/氛围 — 氛围和时间段
  5. 画质 — 细节程度和渲染质量

示例

基础:

一只猫坐在窗台上

更好:

a fluffy orange tabby cat sitting on a sunny windowsill, warm afternoon light, cozy interior, highly detailed, photorealistic

风格关键词

风格关键词
写实photorealistic, highly detailed, 8K, professional photography
赛博朋克neon lights, futuristic, dystopian, rain-slicked streets
水墨画Chinese ink painting, traditional art style, brush strokes
水彩watercolor painting, soft edges, flowing colors
动漫anime style, Japanese animation, cel shading
极简minimalist, clean lines, simple composition, white space

提示词请使用英文 — 图片模型基于英文描述训练。如果你用中文描述,AI 会自动翻译。

提示词增强

AI 默认原样传递你的提示词。它只在以下情况下才会主动提出增强提示词:

  • 提示词非常短(仅几个词),
  • 你没有要求逐字生成。

当你接受增强时,AI 会补充风格、光影和构图细节,并在提交前展示扩写后的提示词。例如,"cyberpunk" 会扩写为 "neon lights, futuristic, dystopian, rain-slicked streets"。

对于已经很长、详尽或结构化的提示词,AI 绝不会改写 — 它会把你当作有经验的用户。当你说类似"完全 按这个提示词"时,它也会原封不动地保留提示词。

参考图

参考图引导 AI 的风格,而非内容。你的提示词仍然控制图片中出现的内容。一次请求最多可提供 5 张 参考图,本地文件和 URL 可混用。

支持格式:jpgpngwebpgif。单文件最大 10 MB。

使用本地文件

该技能直接接受本地文件路径。在 AI 询问参考图时提供路径(例如 ./sketch.png)即可 — 它会为你上传 文件,无需图床。

使用图片 URL

  1. 将参考图上传到图床(imgbb.comsm.mspostimages.org
  2. 复制图片直链(以 .jpg.png.webp.gif 结尾)
  3. 在 AI 询问参考图时提供 URL

你可以在同一次请求中混用本地文件和 URL — 例如一张本地草图加一张托管的照片。

使用 Base64 编码数据(API)

通过图片生成 API 调用时,还可以使用 inlineData 字段直接传入 base64 编码的图片数据,无需上传图床。适用于已经在内存中持有图片的程序化场景。

每张参考图必须且仅能使用 fileData(URL)或 inlineData(base64)之一。请求格式和代码示例请参阅 API 参考文档

输出

输出方式取决于配置时设置的 outputMode

  • inline(默认) — 图片直接显示在对话中
  • download — 保存到当前项目的 .listenhub/image-gen/YYYY-MM-DD-{id}/ 目录下
  • both — 内联显示并同时保存到本地

如需更改输出方式,在 AI 显示当前配置时说"重新配置"即可。

API 参考

接口详情、请求参数、provider/model 矩阵和代码示例请查看图片生成 API 参考文档

本页内容