跳转至

图像生成

OpenAI 生图 / Gemini 文生图 · 分别转发至对应官方

六哥支持两条生图路线,分别走对应厂商的原生端点:OpenAI Image API(GPT Image / DALL·E)和 Gemini 文生图(Nano Banana 系列)。各端点转发给各厂商,参数与官方一致。

flowchart LR
    U["你的代码"] -->|Bearer Key| G["六哥 API"]
    G -->|"/v1/images/generations"| O["OpenAI 生图模型<br/>gpt-image-1 / dall-e-3"]
    G -->|"/v1beta/interactions<br/>(图像模型)"| M["Gemini 文生图<br/>Nano Banana"]
    O --> G
    M --> G
    G -->|图片 base64| U
    classDef gw fill:#334155,stroke:#334155,color:#fff;
    classDef oa fill:#10a37f,stroke:#10a37f,color:#fff;
    classDef ge fill:#4285f4,stroke:#4285f4,color:#fff;
    classDef im fill:#d97706,stroke:#d97706,color:#fff;
    class G gw; class O oa; class M ge; class U im;

① OpenAI Image API

端点:POST https://6geapi.com/v1/images/generations(生成)、/v1/images/edits(编辑)。返回 base64(b64_json)。

curl -X POST "https://6geapi.com/v1/images/generations" \
  -H "Authorization: Bearer $LIUGE_API_KEY" \
  -H "content-type: application/json" \
  -d '{
    "model": "gpt-image-1",
    "prompt": "一只戴橙围巾的灰虎斑猫抱着水獭",
    "size": "1024x1024",
    "quality": "high"
  }' | jq -r '.data[0].b64_json' | base64 --decode > cat.png
from openai import OpenAI
import base64
client = OpenAI(base_url="https://6geapi.com/v1", api_key="你的Key")
res = client.images.generate(
    model="gpt-image-1",
    prompt="一只戴橙围巾的灰虎斑猫抱着水獭",
    size="1024x1024",
    quality="high",
)
img = base64.b64decode(res.data[0].b64_json)
open("cat.png", "wb").write(img)

OpenAI 生图参数

参数 说明
model gpt-image-1(推荐)/ gpt-image-1-mini(更便宜)/ dall-e-3(将弃用)
prompt ✅ 提示词
n 一次生成几张(默认 1)
size 1024x1024 / 1536x1024(横)/ 1024x1536(竖)/ auto
quality low / medium / high / auto(越大越贵越慢)
output_format png(默认)/ jpeg / webp
output_compression 0–100(仅 jpeg/webp)
background transparent(透明)/ opaque / auto(仅 png/webp 支持透明)
moderation auto(默认)/ low(更宽松)

延迟提示

复杂提示词最多约 2 分钟才出图。对延迟敏感时优先 jpeg(比 png 快)。

编辑(inpainting / 参考图)

res = client.images.edit(
    model="gpt-image-1",
    image=[open("woman.jpg", "rb"), open("logo.png", "rb")],   # 多张参考图
    prompt="把 logo 印到她的黑色 T 恤上",
    input_fidelity="high",   # 保留输入细节
)
open("out.png", "wb").write(base64.b64decode(res.data[0].b64_json))

② Gemini 文生图(Nano Banana)

走 Gemini 的 Interactions 端点,把模型换成专门的图像模型;结果在 interaction.output_image.data(base64)。

用专门的图像模型

Gemini 生图需用图像模型(如 gemini-2.5-flash-image),与文本模型 gemini-3-pro-proview 不同。具体可用名称以六哥控制台为准。

curl -X POST "https://6geapi.com/v1beta/interactions" \
  -H "Authorization: Bearer $LIUGE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-2.5-flash-image",
    "input": "画一只未来感、瓶中城市的猫",
    "response_format": {"type":"image","aspect_ratio":"16:9","image_size":"2K"}
  }'
import base64
it = client.interactions.create(
    model="gemini-2.5-flash-image",
    input="画一只未来感、瓶中城市的猫",
    response_format={"type":"image","aspect_ratio":"16:9","image_size":"2K"},
)
open("cat.png", "wb").write(base64.b64decode(it.output_image.data))
Gemini 图像模型参考(以控制台为准)
模型 特点
gemini-2.5-flash-image Nano Banana,速度快、性价比高
gemini-3.1-flash-image 全能型,支持 4K、文字渲染好
gemini-3-pro-image 专业级,复杂构图最强
gemini-3.1-flash-lite-image 最便宜最快(仅 1K)

重点:分辨率 1K / 2K / 4K 怎么选

两套体系,别混

Geminiresponse_format.image_size1K / 2K / 4K(注意大写 K,小写会被拒);OpenAI 没有「K」概念,用 size(像素)+ quality 控制清晰度。

1K≈1024px · 最快最省
2K≈2048px · 均衡
4K≈4096px · 最精细最贵

Gemini 3.1 Flash Image 分辨率与 token 消耗(节选)

宽高比 1K 像素 / token 2K 像素 / token 4K 像素 / token
1:1 1024² / 1120 2048² / 1120 4096² / 2000
16:9 1376×768 / 1120 2752×1536 / 1120 5504×3072 / 2000
9:16 768×1376 / 1120 1536×2752 / 1120 3072×5504 / 2000
3:2 1264×848 / 1120 2528×1696 / 1120 5056×3392 / 2000
4:3 1200×896 / 1120 2400×1792 / 1120 4800×3584 / 2000

1K 与 2K 在多数宽高比下 token 相同(~1120),4K 才明显变贵(~2000 token)。因此 「2K」往往是性价比甜点。512px(0.5K) 仅 3.1 Flash Image 支持。

选择建议

场景 推荐
头像 / 图标 / 缩略图(要快) Gemini 1K 或 OpenAI quality: low
社交媒体配图、博客插图 Gemini 2K(性价比最优)
海报、打印、精修商业图 Gemini 4K + gemini-3-pro-image,或 OpenAI quality: high
需透明背景 OpenAI background: transparent(png/webp)
大量出图、预算敏感 gemini-3.1-flash-lite-image(仅 1K)或 gpt-image-1-mini

提示词技巧

  • 越具体越好:「带银叶纹饰的精灵板甲,高领,肩甲是猎鹰翅膀形」胜过「奇幻盔甲」。
  • 说清用途:「为高端极简护肤品牌设计 Logo」比「设计个 Logo」效果好。
  • 分步描述复杂场景:先背景,再主体,再细节。
  • 用正向描述代替「不要」:要空旷街道,写「一条空无一人的街道」,别写 no cars
  • 用摄影 / 电影语言控构图wide-angle shotmacrolow-angle

水印与内容策略

Gemini 生成的所有图片都带 SynthID 水印;OpenAI 所有图均经内容策略过滤。