Skip to content

Gemini Omni Flash - vídeo do modelo de chat

google/gemini-omni-flash-preview - Modelo multimodal do Google: um endpoint de bate-papo regular que gera vídeo a partir de texto, múltiplas imagens/GIFs, áudio e vídeo de origem simultaneamente. A forma mais barata de colocar vídeos na plataforma é ≈ US$ 0,08 por vídeo.

Como é diferente dos modelos de mídia?

Omni FlashModelos de vídeo regulares (/media/generate)
Ponto finalPOST /v1/chat/completionsPOST /media/generate
Pagamentopor tokens (entrada $ 0,2322 / saída $ 1,3932 por 1 milhão)correção para geração
Velocidade~ 40–60 seg, resposta síncronatarefa + pesquisa
Preço do vídeo**≈ $ 0,08 **a partir de $ 0,11

Como usar (API)

Solicitação OpenAI-compatível regular + parâmetro modalities:

bash
curl https://nordrouter.com/v1/chat/completions \
  -H "Authorization: Bearer sk-nr-ВАШ-КЛЮЧ" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/gemini-omni-flash-preview",
    "messages": [{"role": "user", "content": "Сгенерируй видео: красный воздушный шар над спокойным морем"}],
    "modalities": ["image", "text"],
    "max_tokens": 4000
  }'

Imagens, GIFs, entrada de áudio e vídeo

Passe as partes em uma matriz regular messages[].content. Os formatos abaixo são testados com uma solicitação combinada real via NordRouter:

json
{
  "model": "google/gemini-omni-flash-preview",
  "messages": [{
    "role": "user",
    "content": [
      { "type": "text", "text": "Сделай рекламный ролик: герой с фото движется как в референсном видео, монтаж попадает в ритм аудио" },
      { "type": "image_url", "image_url": { "url": "https://example.com/hero.png" } },
      { "type": "image_url", "image_url": { "url": "https://example.com/style.gif" } },
      { "type": "input_audio", "input_audio": { "data": "BASE64_AUDIO", "format": "wav" } },
      { "type": "video_url", "video_url": { "url": "https://example.com/motion.mp4" } }
    ]
  }],
  "modalities": ["image", "text"],
  "max_tokens": 4000
}
  • Imagens e GIF: image_url; você pode adicionar várias peças seguidas.
  • Áudio: input_audio com base64 e format (wav, mp3, ogg, aac, flac, m4a).
  • Vídeo: video_url; para edição, use um arquivo de origem curto de até 10 segundos.
  • No Studio e no bot: até 10 anexos, cada arquivo com até 20 MB.
  • Arquivos arbitrários e documentos de escritório não são reivindicados para Omni Flash - use imagens, GIFs, áudio ou vídeo.

A resposta vem em uma mensagem; o link para o arquivo finalizado está em message.videos:

json
{
  "choices": [{
    "message": {
      "role": "assistant",
      "content": "I've generated the video for you.",
      "videos": [{ "type": "video_url",
                   "video_url": { "url": "https://nordrouter.com/media/file/…" } }]
    }
  }],
  "usage": { "prompt_tokens": 18, "completion_tokens": 58197, "total_tokens": 58215 }
}

Importante

  • modalities: ["image", "text"] é obrigatório - sem ele, o modelo responde apenas com texto.
  • O vídeo pesa aproximadamente 58 mil tokens de saída → total ≈ US$ 0,08. Defina max_tokens como pelo menos 4.000 (os tokens de vídeo não estão limitados ao limite, o limite se aplica à parte do texto).
  • O arquivo é armazenado por 14 dias - baixe para salvá-lo para sempre.
  • Também funciona com stream: true - o link virá no stream.

No estúdio e no bot do Telegram

O mesmo modelo está disponível sem código:

  • Estúdionordrouter.com/studio→ Vídeo → Gemini Omni Flash;
  • Bot@nordy_robot— Mídia → 📹 Vídeo → Gemini Omni Flash: envie até 10 arquivos, um por vez, e depois um prompt de texto; o vídeo chegará ao mesmo chat.

O preço no estúdio/bot é baseado em tokens reais, geralmente ≈ US$ 0,08 (a estimativa preliminar mostra um limite superior de ~$ 0,13, a diferença é retornada após a geração).