图像生成¶
OpenAI 生图 / Gemini 文生图 · 分别转发至对应官方
六哥支持两条生图路线,分别走对应厂商的原生端点:OpenAI Image API(GPT Image / DALL·E)和 Gemini 文生图(Nano Banana 系列)。各端点转发给各厂商,参数与官方一致。
flowchart LR
U["你的代码"] -->|Bearer Key| G["六哥 API"]
G -->|"/v1/images/generations"| O["OpenAI 生图模型<br/>gpt-image-1 / dall-e-3"]
G -->|"/v1beta/interactions<br/>(图像模型)"| M["Gemini 文生图<br/>Nano Banana"]
O --> G
M --> G
G -->|图片 base64| U
classDef gw fill:#334155,stroke:#334155,color:#fff;
classDef oa fill:#10a37f,stroke:#10a37f,color:#fff;
classDef ge fill:#4285f4,stroke:#4285f4,color:#fff;
classDef im fill:#d97706,stroke:#d97706,color:#fff;
class G gw; class O oa; class M ge; class U im;
① OpenAI Image API¶
端点:POST https://6geapi.com/v1/images/generations(生成)、/v1/images/edits(编辑)。返回 base64(b64_json)。
OpenAI 生图参数¶
| 参数 | 说明 |
|---|---|
model |
gpt-image-1(推荐)/ gpt-image-1-mini(更便宜)/ dall-e-3(将弃用) |
prompt |
✅ 提示词 |
n |
一次生成几张(默认 1) |
size |
1024x1024 / 1536x1024(横)/ 1024x1536(竖)/ auto |
quality |
low / medium / high / auto(越大越贵越慢) |
output_format |
png(默认)/ jpeg / webp |
output_compression |
0–100(仅 jpeg/webp) |
background |
transparent(透明)/ opaque / auto(仅 png/webp 支持透明) |
moderation |
auto(默认)/ low(更宽松) |
延迟提示
复杂提示词最多约 2 分钟才出图。对延迟敏感时优先 jpeg(比 png 快)。
编辑(inpainting / 参考图)¶
res = client.images.edit(
model="gpt-image-1",
image=[open("woman.jpg", "rb"), open("logo.png", "rb")], # 多张参考图
prompt="把 logo 印到她的黑色 T 恤上",
input_fidelity="high", # 保留输入细节
)
open("out.png", "wb").write(base64.b64decode(res.data[0].b64_json))
② Gemini 文生图(Nano Banana)¶
走 Gemini 的 Interactions 端点,把模型换成专门的图像模型;结果在 interaction.output_image.data(base64)。
用专门的图像模型
Gemini 生图需用图像模型(如 gemini-2.5-flash-image),与文本模型 gemini-3-pro-proview 不同。具体可用名称以六哥控制台为准。
Gemini 图像模型参考(以控制台为准)
| 模型 | 特点 |
|---|---|
gemini-2.5-flash-image |
Nano Banana,速度快、性价比高 |
gemini-3.1-flash-image |
全能型,支持 4K、文字渲染好 |
gemini-3-pro-image |
专业级,复杂构图最强 |
gemini-3.1-flash-lite-image |
最便宜最快(仅 1K) |
重点:分辨率 1K / 2K / 4K 怎么选¶
两套体系,别混
Gemini 用 response_format.image_size 选 1K / 2K / 4K(注意大写 K,小写会被拒);OpenAI 没有「K」概念,用 size(像素)+ quality 控制清晰度。
1K≈1024px · 最快最省
2K≈2048px · 均衡
4K≈4096px · 最精细最贵
Gemini 3.1 Flash Image 分辨率与 token 消耗(节选)¶
| 宽高比 | 1K 像素 / token | 2K 像素 / token | 4K 像素 / token |
|---|---|---|---|
| 1:1 | 1024² / 1120 | 2048² / 1120 | 4096² / 2000 |
| 16:9 | 1376×768 / 1120 | 2752×1536 / 1120 | 5504×3072 / 2000 |
| 9:16 | 768×1376 / 1120 | 1536×2752 / 1120 | 3072×5504 / 2000 |
| 3:2 | 1264×848 / 1120 | 2528×1696 / 1120 | 5056×3392 / 2000 |
| 4:3 | 1200×896 / 1120 | 2400×1792 / 1120 | 4800×3584 / 2000 |
1K 与 2K 在多数宽高比下 token 相同(~1120),4K 才明显变贵(~2000 token)。因此 「2K」往往是性价比甜点。512px(0.5K) 仅 3.1 Flash Image 支持。
选择建议¶
| 场景 | 推荐 |
|---|---|
| 头像 / 图标 / 缩略图(要快) | Gemini 1K 或 OpenAI quality: low |
| 社交媒体配图、博客插图 | Gemini 2K(性价比最优) |
| 海报、打印、精修商业图 | Gemini 4K + gemini-3-pro-image,或 OpenAI quality: high |
| 需透明背景 | OpenAI background: transparent(png/webp) |
| 大量出图、预算敏感 | gemini-3.1-flash-lite-image(仅 1K)或 gpt-image-1-mini |
提示词技巧¶
- 越具体越好:「带银叶纹饰的精灵板甲,高领,肩甲是猎鹰翅膀形」胜过「奇幻盔甲」。
- 说清用途:「为高端极简护肤品牌设计 Logo」比「设计个 Logo」效果好。
- 分步描述复杂场景:先背景,再主体,再细节。
- 用正向描述代替「不要」:要空旷街道,写「一条空无一人的街道」,别写
no cars。 - 用摄影 / 电影语言控构图:
wide-angle shot、macro、low-angle。
水印与内容策略
Gemini 生成的所有图片都带 SynthID 水印;OpenAI 所有图均经内容策略过滤。