Um prompt da OpenAI pode parecer barato quando você testa apenas uma linha. Mas, ao repeti-lo em 10.000 ou 100.000 linhas de uma planilha, a conta de tokens fica muito mais difícil de ignorar. O OpenAI Flex Mode reduz esse custo de processamento nos modelos compatíveis quando sua tarefa pode aceitar respostas mais lentas e menos previsíveis.

O Datablist torna essa escolha prática. Você pode importar um arquivo CSV ou Excel, executar um prompt por linha com o enrichment Ask ChatGPT/OpenAI, visualizar uma prévia dos resultados, ativar o Flex e analisar falhas sem precisar criar um pipeline de API. Se você ainda precisa entender a configuração geral, consulte o guia para executar prompts do ChatGPT em linhas de arquivos CSV ou Excel.

Neste guia, usarei uma tarefa de classificação de tickets de suporte para mostrar como decido se o Flex é adequado, estimo os custos de Standard e Flex, configuro a execução e trato linhas atrasadas ou com falha. O objetivo não é obter um modelo mais rápido nem respostas melhores. É realizar a mesma tarefa linha a linha pagando menos por token quando o custo importa mais do que o tempo.

O que muda com o OpenAI Flex Mode

Flex é um service tier disponível para modelos compatíveis da API da OpenAI. A solicitação continua passando pela Responses API ou Chat Completions API, mas usa service_tier: "flex". Em troca de aceitar um processamento mais lento e eventuais restrições de capacidade, você paga as tarifas de tokens do Flex.

Segundo a OpenAI, os tokens do Flex seguem as tarifas da Batch API. Na página de preços da OpenAI, consultada em 16 de julho de 2026, as tarifas do Flex eram iguais às do Batch. Para o gpt-5.4-mini, os preços de tokens de entrada e saída do Flex eram 50% menores que os do Standard.

Trata-se de uma opção de processamento, não de outro modelo. Seu prompt, suas linhas de entrada e seu schema de saída podem permanecer iguais. A diferença está na operação:

  • as respostas podem demorar mais
  • o tempo de conclusão é menos previsível
  • há maior probabilidade de timeout nas solicitações
  • a OpenAI pode retornar 429 Resource Unavailable quando não houver capacidade no Flex

O guia de processamento Flex da OpenAI informa que solicitações sem recursos disponíveis não são cobradas. Você pode tentar novamente mais tarde ou mudar as linhas com falha para o processamento Standard quando concluir a tarefa for mais importante do que economizar.

O Flex também é diferente da OpenAI Batch API. O Batch é uma API assíncrona dedicada a jobs enviados em lote. Já o Flex é um service tier aplicado a solicitações normais de API compatíveis. O Datablist gerencia o fluxo linha a linha dessas solicitações, portanto você não precisa criar nem monitorar um job no Batch por conta própria.

Ele também não faz parte da assinatura do ChatGPT na web. O uso da API e do aplicativo ChatGPT têm cobranças e fluxos separados. No Datablist, você pode usar sua própria chave da API da OpenAI ou créditos do Datablist nos modelos compatíveis.

🔑 A regra principal

O Flex altera o custo e o tempo de processamento. Ele não melhora a qualidade das respostas e não está disponível para todos os modelos.

Para saber mais sobre a execução de prompts recorrentes em escala, consulte processamento de LLM em lote.

Quando vale a pena usar o Flex Mode

Começo com uma pergunta: esta execução pode esperar mais se custar menos?

Se a resposta for sim, vale a pena considerar o Flex. Bons exemplos incluem classificação noturna de tickets, resumo de avaliações, extração estruturada de textos e categorização de leads em segundo plano. Um job grande e não urgente para traduzir catálogos de e-commerce com o ChatGPT também pode funcionar bem, desde que o modelo escolhido seja compatível com o Flex.

Essas tarefas compartilham três características: repetem um prompt estável em muitas linhas, geram uma saída que pode ser revisada depois e não deixam uma pessoa esperando por cada resposta.

Continue usando o processamento Standard quando:

  • alguém precisar do resultado durante a mesma sessão
  • uma linha atrasada ou com falha bloquear um fluxo urgente
  • o modelo escolhido não for compatível com o Flex
  • o job exigir uma latência previsível, mesmo que custe mais

Também evito levar um prompt novo diretamente para uma grande execução no Flex. Primeiro, estabilizo o prompt e o schema de saída com uma pequena prévia. O Flex barateia o processamento, mas não corrige instruções vagas, textos de entrada desnecessários nem respostas grandes demais.

💡 Use o Flex quando o prompt estiver estável

Teste primeiro entre 10 e 20 linhas. Quando os rótulos, resumos e critérios de revisão estiverem corretos, o Flex se torna uma escolha sensata para a execução em segundo plano.

O enrichment Ask ChatGPT/OpenAI do Datablist é ideal para esse cenário porque executa um prompt por linha, armazena as respostas em propriedades e mantém os status de processamento de cada linha para revisão.

Exemplo de CSV e prompt

Usarei o arquivo de exemplo Support tickets AI do Datablist. Você pode encontrá-lo na biblioteca de arquivos CSV de exemplo. A versão com 100 linhas é pequena o suficiente para a configuração e as capturas de tela, enquanto a versão com 10.000 linhas deixa a diferença de custo mais evidente.

A entrada contém estas colunas úteis:

  • Ticket Subject
  • Ticket Text
  • Customer Plan
  • Priority Hint

Todas as linhas exigem a mesma tarefa: classificar o ticket, atribuir uma urgência, resumir o problema e sinalizar casos incertos para revisão. É um ótimo candidato ao Flex porque pode ser processado em segundo plano e cada resposta é curta.

Este é o prompt que eu usaria inicialmente:

Classifique este ticket de suporte para relatórios operacionais.

Assunto do ticket: {{Ticket Subject}}

Texto do ticket: {{Ticket Text}}

Plano do cliente: {{Customer Plan}}

Indicação de prioridade: {{Priority Hint}}

Retorne apenas valores estruturados e curtos.

As expressões entre chaves duplas são variáveis de prompt. O Datablist as substitui pelos valores da linha processada.

As variáveis do prompt inserem os campos do ticket na solicitação à OpenAI
As variáveis do prompt inserem os campos do ticket na solicitação à OpenAI

Prefiro quatro saídas estruturadas em vez de um único bloco de texto:

  • Ticket Topic: Billing, Bug, Feature Request, Account Access, Cancellation ou Other
  • Urgency: Low, Medium ou High
  • One Sentence Summary: uma frase objetiva
  • Needs Review: Yes quando o ticket for ambíguo, estiver incompleto, contrariar a indicação de prioridade ou não produzir resultado

Esse schema facilita a filtragem e mantém os tokens de saída sob controle. Ele também separa as linhas incertas da fila normal, em vez de esconder a dúvida dentro de um parágrafo.

Configure propriedades de saída separadas para a resposta estruturada da OpenAI
Configure propriedades de saída separadas para a resposta estruturada da OpenAI

Estime o custo de Standard e Flex antes de começar

A estimativa de custos deve vir antes da configuração completa. Você precisa saber se a economia justifica o processamento mais lento para a quantidade real de linhas.

O cálculo tem duas partes:

  • custo de entrada = linhas × média de tokens de entrada por linha × preço por token de entrada
  • custo de saída = linhas × média de tokens de saída por linha × preço por token de saída
  • custo total = custo de entrada + custo de saída

Neste exemplo, usarei o gpt-5.4-mini, com 250 tokens de entrada e 30 tokens de saída por linha. Os preços abaixo foram consultados em 16 de julho de 2026:

Service tierPreço de entrada por 1 milhão de tokensPreço de saída por 1 milhão de tokens
StandardUS$ 0,75US$ 4,50
FlexUS$ 0,375US$ 2,25

Para 1.000 linhas, o custo de entrada no Standard é 250.000 × US$ 0,75 / 1.000.000, ou US$ 0,1875. O custo de saída é 30.000 × US$ 4,50 / 1.000.000, ou US$ 0,135. No total, a execução custa cerca de US$ 0,32.

Neste exemplo, o Flex reduz as duas tarifas pela metade, portanto a mesma carga custa aproximadamente US$ 0,16.

LinhasEstimativa StandardEstimativa FlexEconomia estimada
1.000US$ 0,32US$ 0,16US$ 0,16
10.000US$ 3,23US$ 1,61US$ 1,61
100.000US$ 32,25US$ 16,13US$ 16,13

Os valores individuais são baixos porque o prompt e as respostas são compactos. Substitua um ticket curto por uma transcrição extensa, uma descrição de produto ou uma página extraída, e o custo de entrada aumentará rapidamente. Peça uma resposta detalhada em vez de quatro campos curtos, e o custo de saída também subirá.

Uso essa tabela como método, não como orçamento definitivo. Antes de uma execução real, atualize quatro elementos: modelo, preços do service tier, média de tokens de entrada e média de tokens de saída. A disponibilidade e os preços dos modelos mudam, portanto consulte novamente a página da OpenAI em vez de copiar uma estimativa antiga.

Se você usar sua própria chave de API, a OpenAI cobrará sua conta. Se usar créditos do Datablist, o Datablist converterá o consumo de processamento em créditos nos modelos compatíveis. O consumo exato depende do modelo e da quantidade de tokens, por isso continuo mantendo prompts e respostas compactos.

⚠️ Os preços mudam

A economia de 50% se aplica ao modelo compatível e aos preços verificados acima. Use o cálculo como um modelo reutilizável, não como uma tabela permanente de preços nem como uma promessa válida para todos os modelos.

Configure o Ask ChatGPT/OpenAI no Datablist

Quando a carga de trabalho e a economia fizerem sentido, configure o enrichment. Faço cada ajuste com cuidado, pois qualquer configuração inadequada será multiplicada por todas as linhas.

1. Importe o CSV ou abra uma collection

Importe o arquivo CSV ou Excel para o Datablist ou abra uma collection que já contenha as linhas. Confirme se as quatro colunas de entrada possuem valores úteis. Filtro tickets sem texto antes de chamar o modelo, pois ninguém ganha ao pagar por linhas sem conteúdo relevante.

2. Selecione Ask ChatGPT/OpenAI

Abra Enrich e escolha Ask ChatGPT/OpenAI. Esse enrichment envia uma solicitação para cada linha selecionada e grava a resposta nas propriedades de saída configuradas.

3. Escolha como pagar pelo processamento

Use sua própria chave da API da OpenAI para receber a cobrança diretamente da OpenAI ou escolha créditos do Datablist quando houver suporte para o modelo e a conta selecionados. A escolha do processing tier é independente da forma de pagamento.

4. Adicione o prompt para cada linha

Cole o prompt do ticket de suporte e insira cada campo pelo seletor de variáveis. Mantenho a instrução curta e coloco o formato desejado no final. Repetir informações de contexto em todas as linhas desperdiça tokens de entrada.

Se um campo do ticket costuma ficar vazio, defina como o modelo deve tratá-lo. Por exemplo, Needs Review = Yes é mais seguro do que permitir que o modelo invente o contexto ausente.

5. Configure as propriedades de saída estruturada

Ative a opção de saída estruturada e adicione as quatro propriedades do exemplo. Use descrições curtas para cada campo e defina os rótulos permitidos quando necessário.

A saída estruturada poupa trabalho de limpeza, mas seu principal valor aqui é o controle. Um campo chamado Urgency, com três rótulos permitidos, reduz a chance de o modelo retornar uma explicação longa.

6. Selecione um modelo compatível com Flex

Abra o seletor de modelos e escolha um modelo marcado como flex compatible. O Datablist só exibe a configuração do Flex quando o modelo selecionado é compatível.

Seletor de modelos da OpenAI com modelos compatíveis com Flex no Datablist
Seletor de modelos da OpenAI com modelos compatíveis com Flex no Datablist

Para este exemplo de custo, uso o GPT-5.4 mini. Não presuma que a mesma lista continuará disponível. Ao iniciar um novo workflow, verifique o rótulo no Datablist e a página atual de preços da OpenAI.

7. Ative o Flex Mode

Ative Advanced Settings e depois habilite Use Flex Mode.

Use Flex Mode ativado nas configurações avançadas do Datablist
Use Flex Mode ativado nas configurações avançadas do Datablist

Se o botão não aparecer, o modelo selecionado não está marcado como compatível com Flex no Datablist. Escolha um modelo compatível ou mantenha o processamento Standard.

8. Comece com o timeout padrão

O timeout padrão atual do Flex no Datablist é de 360 segundos, ou 6 minutos. Eu não o altero na primeira prévia. Aumente o valor somente após ocorrerem falhas por timeout e apenas se o job puder esperar mais.

O intervalo aceito é de 30 a 1.500 segundos. Um timeout maior dá mais tempo para uma solicitação lenta terminar, mas não garante capacidade nem uma resposta dentro de um prazo fixo.

9. Mantenha o cache quando houver duplicatas

O Datablist pode armazenar em cache, por 48 horas, prompts idênticos executados com as mesmas configurações. Se tickets ou descrições duplicados gerarem a mesma solicitação, o resultado em cache evita outra chamada paga.

O cache não substitui a deduplicação. Primeiro filtro as linhas desnecessárias e depois uso o cache como uma segunda camada.

10. Limite os tokens de saída e controle a concorrência

Defina um limite de tokens adequado aos quatro campos curtos. Não deixe espaço para uma redação quando você só precisa de rótulos e uma frase.

Se estiver usando sua própria chave de API, mantenha um número conservador de chamadas simultâneas. Aumentar a concorrência não torna a capacidade do Flex mais previsível e pode gerar erros de rate limit. Prefiro uma execução constante em segundo plano a uma rajada seguida de novas tentativas.

📘 O botão do Flex não aparece?

Verifique primeiro o rótulo do modelo. O Datablist só exibe as configurações do Flex para modelos marcados como compatíveis. Caso contrário, escolha outro modelo compatível ou execute no Standard.

Visualize, execute e analise os resultados

Visualize uma prévia de 10 a 20 linhas antes de processar o arquivo completo. Faço isso mesmo quando o prompt parece óbvio. Pequenas mudanças no texto podem alterar os rótulos, o tamanho das respostas e o consumo de tokens em milhares de solicitações.

Verifique estes pontos na prévia:

  • todas as propriedades esperadas recebem um valor
  • Ticket Topic usa rótulos consistentes
  • Urgency considera o texto do ticket em vez de apenas copiar Priority Hint
  • os resumos permanecem limitados a uma frase
  • Needs Review identifica informações ausentes ou conflitantes
  • os tamanhos das entradas e saídas ficam próximos das estimativas de custo

Um resultado representativo deve ser semelhante a este:

Ticket SubjectTicket TopicUrgencyOne Sentence SummaryNeeds Review
Não consigo entrar após redefinir a senhaAccount AccessHighO cliente não consegue acessar a conta após redefinir a senha.No

Se o modelo retornar rótulos inconsistentes, restrinja os valores permitidos antes da execução completa. Se os resumos estiverem longos demais, encurte a instrução e reduza o limite de tokens. Corrigir o prompt após 10 linhas custa pouco. Corrigi-lo depois de 100.000 linhas, não.

Quando a prévia estiver estável, execute o enrichment nas linhas desejadas. O Datablist acompanha os itens processados, o que ajuda a evitar novas chamadas à OpenAI para linhas já concluídas.

Após a execução, filtre as linhas com status de falha, timeout ou sem resultado. Analise uma amostra de cada grupo antes de tentar novamente:

  • tente novamente com o Flex quando o erro parecer temporário e o job puder esperar
  • aumente o timeout do Flex quando solicitações com entradas longas e válidas expirarem de forma recorrente
  • processe novamente as linhas críticas no Standard quando a conclusão ou a velocidade importar mais do que o custo
  • corrija dados de entrada ausentes antes de gastar com outra solicitação
Analise os resultados da OpenAI linha a linha na collection do Datablist
Analise os resultados da OpenAI linha a linha na collection do Datablist

Quando os resultados forem aprovados na revisão, exporte a collection processada para CSV ou Excel. Mantenha Needs Review na exportação se outra pessoa for validar os tickets incertos posteriormente.

Outras formas de reduzir custos

O Flex é apenas uma forma de economizar. Em muitos arquivos, a maior redução vem do envio de menos dados e da eliminação de chamadas desnecessárias.

Filtre as linhas antes do processamento

Remova linhas vazias, tickets já classificados e registros fora do escopo do job. A solicitação mais barata é aquela que você não envia.

Reduza o prompt e os dados de entrada

Inclua apenas os campos necessários para o modelo. Um ID de cliente pode ajudar a combinar os resultados depois, mas o modelo não precisa lê-lo. O mesmo vale para assinaturas longas, históricos de e-mails citados e textos padrão dentro de um ticket.

Mantenha as respostas curtas e estruturadas

Use rótulos, valores booleanos e resumos concisos. Os tokens de saída costumam custar mais do que os de entrada, portanto um limite baixo pode gerar uma economia relevante.

Use o cache para prompts repetidos

Ative o cache quando solicitações idênticas puderem se repetir. Isso funciona bem com descrições duplicadas ou textos recorrentes após a importação de vários arquivos.

Escolha o menor modelo que atenda ao padrão de qualidade

Visualize as mesmas linhas representativas antes de trocar de modelo. Um modelo mais barato só é útil se os rótulos e a taxa de revisão continuarem aceitáveis.

Prefira um enrichment específico para tarefas fixas

Uma LLM é flexível, mas nem sempre é a ferramenta mais barata. Se você só precisa identificar um idioma, use um workflow específico de detecção de idioma em vez de pedir a um modelo generalista que faça essa inferência em todas as linhas.

Estimo o custo depois de reduzir o prompt e filtrar o dataset. Caso contrário, estaria calculando o preço de uma execução que nem deveria realizar.

Limitações e solução de problemas

O Flex introduz alguns tipos de falha para os quais você deve se preparar.

O modelo selecionado não exibe o Flex

A compatibilidade é limitada e pode mudar. Se o Datablist não exibir o botão do Flex, escolha um modelo marcado como compatível ou use o processamento Standard. Não force um modelo customizado e não verificado em uma execução de grande escala.

As respostas demoram mais do que o esperado

Um processamento mais lento e menos previsível é a principal contrapartida. Isso não indica uma qualidade inferior nas respostas. Deixe as linhas não urgentes continuarem, mas transfira as tarefas urgentes para o Standard.

As linhas atingem o timeout

Comece com o padrão de 360 segundos do Datablist. Se linhas válidas atingirem o timeout e a execução puder esperar, aumente o valor dentro do intervalo aceito. Se apenas algumas linhas críticas falharem, normalmente tento processá-las novamente no Standard em vez de atrasar o job inteiro.

O timeout do próprio SDK da OpenAI é diferente da configuração de timeout do Flex no Datablist. Para este workflow, siga o valor exibido no Datablist.

A OpenAI retorna 429 Resource Unavailable

A capacidade do Flex pode ficar indisponível. Segundo a OpenAI, essas solicitações não são cobradas. Tente novamente mais tarde para obter o menor custo ou use o processamento Standard quando concluir a tarefa for mais importante.

Muitas linhas atingem os rate limits

O Flex não elimina os rate limits da API. Reduza o número de chamadas simultâneas ou processe um segmento menor antes de tentar novamente. Uma execução mais lenta e controlada é mais fácil de analisar do que uma grande sequência de falhas.

Flex, Batch API e ChatGPT estão sendo confundidos

Mantenha as diferenças claras:

  • Flex é um service tier mais barato para solicitações de API compatíveis
  • Batch API é uma API assíncrona separada
  • ChatGPT é o produto web e aplicativo, não o workflow de API linha a linha usado aqui
  • o Datablist oferece o workflow de planilha e pode usar uma chave de API ou créditos

Conclusão

Use o Flex quando o modelo selecionado for compatível, o custo importar mais do que o tempo de resposta e o job puder ser executado em segundo plano. Mantenha o processamento Standard para linhas urgentes, interativas ou sensíveis a falhas.

Minha sequência preferida é simples: estimar o custo de tokens, filtrar o arquivo, configurar saídas estruturadas e curtas, visualizar de 10 a 20 linhas, ativar o Flex, processar a lista e tentar novamente apenas nas linhas necessárias. Assim, você mantém o workflow de CSV simples e reduz pela metade o custo de processamento do modelo analisado.

FAQ

O OpenAI Flex Mode sempre reduz os custos em 50%?

Não. Em 16 de julho de 2026, os preços de entrada e saída do Flex para o gpt-5.4-mini eram 50% menores que os do Standard e iguais às tarifas da Batch API. Os preços e os modelos compatíveis podem mudar. Consulte a página atual de preços da OpenAI para o seu modelo antes de calcular uma grande execução.

Quais modelos da OpenAI são compatíveis com Flex Mode?

A compatibilidade é limitada e muda com o tempo. Consulte a lista atual de preços da OpenAI e procure o rótulo flex compatible no seletor de modelos do Datablist. O botão do Flex só aparece nas opções compatíveis.

Flex Mode é igual à OpenAI Batch API?

Não. Flex é um service tier para solicitações compatíveis da Responses API ou Chat Completions API. A Batch API é uma API assíncrona separada para lotes enviados. Elas podem ter os mesmos preços por token sem oferecer o mesmo workflow.

Flex Mode altera a qualidade das respostas?

O Flex não oferece outro nível de qualidade. Ele altera o processing tier e o tempo da solicitação. O modelo, o prompt e o schema de saída continuam determinando o resultado. Visualize algumas linhas, pois a qualidade do prompt é importante em qualquer tier.

Qual timeout devo usar no Flex Mode do Datablist?

Comece com o padrão de 360 segundos. Aumente-o apenas quando linhas válidas atingirem o timeout e o job puder esperar mais. O Datablist aceita valores de 30 a 1.500 segundos. Um timeout maior dá mais tempo à solicitação, mas não garante disponibilidade.

Posso usar Flex Mode com créditos do Datablist?

O Datablist permite usar uma chave da API da OpenAI ou créditos do Datablist em modelos e configurações de conta compatíveis. O consumo de créditos depende do modelo e da quantidade de tokens. Por isso, visualize uma amostra e mantenha entradas e saídas concisas.

Quando devo continuar usando o processamento Standard?

Use o Standard em trabalhos interativos, jobs urgentes, linhas cujo resultado alguém esteja aguardando, modelos incompatíveis ou processos nos quais respostas atrasadas causariam problemas. Você também pode executar o job em massa no Flex e reprocessar um pequeno grupo de linhas críticas no Standard.

Posso usar Flex Mode com arquivos Excel?

Sim. O Datablist importa arquivos CSV e Excel. O Flex se aplica à solicitação compatível da API da OpenAI, não ao tipo de arquivo de origem. O mesmo workflow de prompts linha a linha funciona com os dois formatos.