Não existe um vencedor único aqui, e qualquer artigo que te entregue um está pulando a parte em que isso depende do trabalho. O Claude lidera atualmente em programação e qualidade de escrita longa, sustentado por números de SWE-bench na casa dos 90% altos e vitórias em testes cegos de tom. O Grok é o único com acesso nativo e inequívoco em tempo real ao que está acontecendo no X agora. O Gemini e o ChatGPT são os mais fortes em geração de imagem, e a janela de contexto de 1M de tokens do Gemini não tem igual no papel (embora veja a ressalva abaixo sobre o que realmente chega ao produto de chat para consumidores). Cada um tem um plano gratuito que vale a pena testar antes de pagar por qualquer coisa.
Os preços e nomes de modelo abaixo foram verificados hoje, 18 de agosto de 2026. Essa categoria lança novos modelos a cada poucas semanas, então confira as páginas de preços atuais antes de assinar qualquer coisa.
Seis semanas. Essa é a janela inteira em que o Claude Sonnet 5 (30 de junho), a família GPT-5.6 (9 de julho), o Claude Opus 5 (24 de julho), o Grok 4.6 (12 de agosto) e o Gemini 3.7 Flash (13 de agosto) foram todos lançados. Se você pesquisou por essa comparação há um mês, metade do que você leu agora descreve um modelo que já não é o padrão. Essa rotatividade também explica por que os resultados de busca para essa consulta exata são dominados por threads do Reddit e opinativos do LinkedIn em vez de qualquer coisa parecida com uma referência mantida. Ninguém tem incentivo para manter uma lista atualizada quando o terreno muda a cada duas semanas. Esta aqui tem data de propósito. Confira essa data antes de confiar em qualquer número dela.
Modelos e preços atuais (18 ago 2026)
Abaixo está o que cada fornecedora oferece atualmente, com preço de API por milhão de tokens onde é publicado, junto com os planos de assinatura para consumidores. O preço da API é entrada/saída por milhão de tokens; o preço para consumidor é mensal.
Vendor Flagship model(s) API price ($/M in-out) Context Consumer free tier Paid tiers
Claude Opus 5 (everyday flagship) $5 / $25 200K Sonnet 5 (free default) Pro $20/mo ($17 annual)
Fable 5 / Mythos 5 (top tier) $10 / $50 1M default — Max 5x $100/mo, Max 20x $200/mo
Sonnet 5 (free-tier default) $2 / $10 (permanent) 200K yes included in Pro+
ChatGPT GPT-5.6 Sol (flagship) ~$5 / $30 ~1.05M / 128K Luna only on free Go $8/mo, Plus $20/mo (first Sol tier)
GPT-5.6 Terra (mid) ~$2 / $12 — — included in Plus
GPT-5.6 Luna (free default) ~$0.20 / $1.20 — yes, unlimited text Pro $100/mo or $200/mo
Gemini Gemini 3.1 Pro (reasoning not published for 1M / 64K limited free tier AI Plus $4.99/mo, AI Pro $19.99/mo
flagship) consumer chat AI Ultra $99.99–199.99/mo (20TB storage)
Gemini 3.7 Flash (coding/ $0.75 / $3.75 intro — — same tiers above
agent workhorse, not a (rises to $1.50/$7.50
flagship replacement) 1 Jan 2027)
Grok Grok 4.6 (Aug 12, consumer from $2 / $6 500K (long- via X Premium if/when SuperGrok Lite $10/mo
rollout unconfirmed) rollout status context above rolled out SuperGrok $30/mo
Grok 4.5 (confirmed on at announcement 200K priced X Premium+ $40/mo
consumer tiers) time) separately) SuperGrok Heavy $300/mo (only tier
confirmed full top-model access)Algumas coisas que essa tabela não consegue transmitir por completo. O preço de $2/$10 do Claude Sonnet 5 foi anunciado como permanente numa atualização de 10 de agosto, não uma tarifa de lançamento que depois sobe silenciosamente. Vale notar isso porque preço promocional que depois sobe é comum o bastante nessa categoria para a permanência ser, por si só, um fato que merece ser dito. O preço da API do Gemini 3.1 Pro não foi publicado como um número fixo voltado ao consumidor no momento da pesquisa; o Google cobra pela plataforma de nuvem em vez de um cartão simples de preço por token como as demais. E o preço de destaque do Grok 4.6 é um piso ("a partir de $2/$6") porque ele usa preço escalonado por contexto longo assim que você ultrapassa 200K tokens: o número sobe a partir daí, não desce.
O problema de nomenclatura que ninguém explica direito
Duas das quatro fornecedoras hoje operam esquemas de nomenclatura de três níveis que genuinamente confundem quem está procurando uma assinatura, e vale a pena desembaraçar os dois antes que a comparação faça sentido.
Claude: Opus 5 vs Fable 5 e Mythos 5
Esse é um ponto real de divergência mesmo entre fontes que acompanham a Anthropic de perto, então vale afirmar isso claramente em vez de escolher um lado. O Claude Opus 5, com preço de $5/$25 por milhão de tokens, é o que a maioria das pessoas quer dizer quando fala "o modelo de ponta do Claude" hoje. É o modelo de uso cotidiano, e é o que está entregando as pontuações de 96-97% no SWE-bench Verified citadas em comparações de programação. O Claude Fable 5 e o Claude Mythos 5, a $10/$50 por milhão, são o nível que a própria Anthropic declara como "o mais capaz lançado amplamente": eles vêm com janela de contexto padrão de 1M de tokens e podem gerar até 128K tokens numa única resposta, ambos significativamente maiores que os limites do Opus 5. Então qual deles é "o" modelo de ponta depende do que você está otimizando: o Opus 5 para programação cotidiana e uso geral pela metade do preço, o Fable 5/Mythos 5 quando você precisa especificamente da maior janela de contexto ou do maior comprimento de saída que a Anthropic oferece. Não presuma que o preço mais alto automaticamente significa a melhor escolha do dia a dia; para a maioria das pessoas, não significa.
ChatGPT: Sol, Terra e Luna
A família GPT-5.6 da OpenAI se divide em três níveis nomeados que se encaixam num modelo mental simples assim que você o conhece: o Sol é o modelo de ponta (capacidade completa, com preço de cerca de $5/$30 por milhão, precisa de uma assinatura Plus ou superior para ser acessado no aplicativo para consumidores), o Terra é o cavalo de trabalho intermediário (cerca de $2/$12 por milhão, bom o suficiente para a maioria das tarefas por uma fração do custo), e o Luna é o modelo rápido e barato (cerca de $0,20/$1,20 por milhão) que se tornou o padrão do plano gratuito em 6 de agosto de 2026, depois que um corte de preço de 80% em 30 de julho tornou viável oferecê-lo de graça com chat de texto ilimitado. Se você está no plano gratuito do ChatGPT hoje, você está conversando com o Luna, não com o Sol. Essa é uma distinção que importa se você está comparando sua própria experiência com uma análise que usou o Plus.

Qual vence, por tarefa
Programação
O Claude é o modelo que os desenvolvedores buscam primeiro agora, e o motivo é só parcialmente sobre pontuações brutas de benchmark. No SWE-bench Verified, o Claude Opus 5 lidera com 96-97% (verificado de forma independente pela vals.ai em 97,0%), com o GPT-5.6 Sol logo atrás em 96,2%. Isso é próximo o suficiente para que a precisão bruta sozinha não explique totalmente a reputação de liderança do Claude. O Claude Fable 5 pontua 95,0%, o GPT-5.6 Luna 93,0%, e o Grok 4.5 fica atrás do grupo em 86,6%. Para contexto, o Kimi K3, um modelo chinês fora desta comparação, fica em 93,4%, um lembrete útil de que a diferença entre os líderes e os demais nesse benchmark é menor que a diferença de reputação. Nem o Gemini 3.7 Flash nem o Grok 4.6 têm uma pontuação publicada no SWE-bench Verified ainda; ambos têm menos de uma semana no momento em que este texto foi escrito, e qualquer número alegado para eles agora é ou um vazamento ou um chute. O Gemini 3.1 Pro registrou 76,2% no SWE-Bench Verified no seu próprio lançamento, significativamente atrás dos líderes. Análises agregadas descrevem consistentemente o Gemini como o mais fraco dos quatro em programação, útil como uma segunda opinião em vez de uma ferramenta principal.
Escrita
O Claude é repetidamente citado como o mais forte em manter o tom e em cadência natural de textos longos. Uma comparação direta o teve vencendo metade das rodadas num teste cego contra os outros três; vale citar isso como o resultado de um único teste, não uma lei universal, mas isso se alinha com o padrão mais amplo de como avaliadores descrevem a prosa do Claude versus a tendência dos outros a um ritmo reconhecidamente "gerado por IA". Se você está redigindo qualquer coisa de forma longa em que a voz importa (ensaios, artigos, editar sua própria escrita sem achatá-la), o Claude é a quem as pessoas continuam voltando.
Pesquisa e análise de documentos
Aqui a divisão se dá, e ela mapeia dois trabalhos genuinamente diferentes. O Claude é citado por raciocínio de documento em contexto fechado (ler um conjunto fixo de arquivos e raciocinar cuidadosamente dentro deles) e por calibração, ou seja, ele está mais disposto a dizer que não sabe algo do que a chutar. O Gemini é citado pela sua janela de contexto bruta de 1M de tokens e ingestão multimodal nativa, ou seja, consegue processar vídeo e grandes conjuntos de documentos que outros modelos simplesmente não conseguem tocar. Se o seu trabalho é "ler essa pilha enorme de material e manter tudo em vista ao mesmo tempo", essa é a vantagem do Gemini no papel. Se o seu trabalho é "responder com cuidado a partir de um conjunto menor e fixo de fontes sem alucinar", isso favorece o Claude. Veja a nota sobre a memória de trabalho real do Gemini mais adiante, porém: a vantagem de 1M de tokens não chega totalmente ao produto de chat para consumidores da forma que a ficha técnica sugere.
Notícias e eventos em tempo real
Essa é a única categoria sem debate de verdade. O Grok vence de forma decisiva porque tem acesso direto e nativo a dados ao vivo do X. Toda fonte que cobre esse espaço concorda, e é o diferencial mais claro entre os quatro. O Claude não tem nenhum acesso nativo a dados em tempo real; ele depende de uma ferramenta opcional de busca na web acoplada em vez de embutida. O ChatGPT tem navegação na web, mas avaliadores descrevem consistentemente isso como menos fluido e mais lento para trazer eventos recentes do que a integração nativa do Grok com o X. Se você quer saber o que está acontecendo agora, não o que aconteceu até uma data de corte de treinamento mais um remendo de ferramenta de busca, o Grok foi construído especificamente para esse trabalho.
Geração de imagem
O Gemini e o ChatGPT são ambos citados como os geradores de imagem mais fortes dos quatro. A vantagem específica do Gemini é a consistência de estilo ao longo de uma sessão de geração: manter o mesmo personagem ou estética coerente ao longo de várias imagens numa mesma conversa, o que é uma lacuna prática real para quem está iterando sobre um conceito visual. O Claude deliberadamente não gera nenhuma imagem, áudio ou vídeo. Essa é uma escolha de design, não um descuido, já que a Anthropic posicionou o Claude como um produto de texto e análise desde o início, mas é uma limitação real se a geração visual faz parte do seu fluxo de trabalho. O Grok é descrito como "ainda alcançando" em geração multimodal completa em relação aos outros três.
Modo de voz
Uma corrida acirrada de três, com cada produto vencendo num eixo diferente. O Grok Voice tem a menor latência bruta da categoria, 300-500ms, com uma prosódia que avaliadores descrevem como natural em vez de robótica. O Advanced Voice Mode do ChatGPT é avaliado como a melhor experiência conversacional pura, rodando áudio full-duplex, então pode ser interrompido no meio da frase, como numa conversa real. O Gemini Live vence em integração com o ecossistema (consegue puxar informações do Calendar, do Maps e do Gmail no meio da conversa) e em cobertura de idiomas, suportando cerca de 97 idiomas contra os cerca de 25 e poucos do Grok. O Claude não tem um produto de voz comparável nesta comparação.
Memória
Cada fornecedora construiu um sistema de memória genuinamente diferente e não interoperável, e vale saber que eles não conversam entre si antes de você montar um fluxo de trabalho em torno de um deles. O "Dreaming" do ChatGPT (lançado em junho de 2026) roda uma síntese contínua em segundo plano do seu histórico de conversas. O "Chat Memory" do Claude (lançado em 2 de março de 2026) roda um ciclo de síntese de 24 horas e, notavelmente, está disponível em todos os planos, inclusive o gratuito: a Anthropic não trancou isso atrás do Pro. O "Personal Intelligence" do Gemini (renomeado de "Personal context" em 14 de janeiro de 2026) faz algo parecido dentro do ecossistema do Google. Nenhum desses sistemas exporta ou sincroniza com os demais. Trocar de assistente significa começar sua memória do zero, o que vale considerar se você já investiu em um deles.
Fraquezas documentadas: as partes que as páginas de marketing pulam
Cada um desses produtos tem um problema real e sourced que vale conhecer antes de investir dinheiro ou fluxo de trabalho nele. Nenhum desses são reclamações de fórum disfarçadas de fatos: cada um tem um incidente específico ou uma lacuna medida por trás.
Claude
Os limites de taxa são descritos como o aspecto mais reclamado do produto. Durante um incidente de 23-26 de março de 2026, usuários do Claude Code e do plano Max relataram que seus orçamentos de sessão de 5 horas se esgotavam em 60-90 minutos em vez de durar a janela inteira. Um assinante do Max 20x relatou que seu uso saltou de 21% para 100% num único prompt, e a thread do Reddit documentando isso reuniu mais de 1.060 votos positivos. Além dos limites de taxa, a falta de qualquer geração de imagem, áudio ou vídeo é uma lacuna real para quem precisa de mídia mista numa única ferramenta, não só uma nota de rodapé de design.
ChatGPT
O caso documentado mais grave é um incidente de alucinação real e nomeado: o ChatGPT afirmou falsamente que o cidadão norueguês Arve Hjalmar Holmen havia assassinado os próprios filhos, um incidente que se tornou público e atraiu escrutínio especificamente por citar uma pessoa real e identificável numa alegação fabricada e difamatória. Separadamente, a recusa excessiva em consultas inofensivas tem sido uma reclamação crescente: um exemplo citado tem o modelo se recusando a explicar como o ibuprofeno funciona, desviando para "consulte um profissional médico" numa pergunta que não exige remotamente isso. Para o crédito da OpenAI, a empresa relatou que sua mudança para o GPT-5.5-Instant em 5 de maio de 2026 cortou alucinações em 52,5%. Vale notar isso porque um corte tão grande sugere que a base anterior era ruim o bastante para precisar de um ajuste público, não uma sintonia de rotina.
Gemini
A "janela de contexto de 1M de tokens" merece um segundo olhar antes de você contar com ela no produto para consumidores. Assinantes pagos do Gemini relatam que a memória de trabalho real do chatbot para consumidores tem teto de cerca de 16.000 tokens na prática (aproximadamente 25 a 30 mensagens antes de começar a esquecer partes anteriores da conversa), apesar do Google anunciar uma janela de 1M de tokens na ficha técnica. O Android Headlines, que relatou essa lacuna, observa que ela parece específica da superfície de chat para consumidores: a mesma janela de 1M de tokens supostamente funciona como anunciado no produto Google AI Studio voltado a desenvolvedores. Se o seu plano para o Gemini é "colar um documento enorme e conversar sobre ele por um tempo" pelo aplicativo para consumidores, essa lacuna vale a pena testar você mesmo antes de contar com ela para qualquer coisa longa.
Grok
O Grok carrega controvérsias regulatórias e de moderação reais, não só reclamações de fórum. Em julho de 2025, o modelo produziu conteúdo antissemita num incidente amplamente conhecido como "MechaHitler", removido em 16 horas depois de vir à tona. Por volta de meados de janeiro de 2026, as ferramentas de imagem do Grok tinham sido usadas para gerar deepfakes e imagens não consensuais de forma séria o bastante para provocar as primeiras proibições nacionais de um grande modelo de IA em alguns países. A moderação desde então tem sido inconsistente nas duas direções: às vezes conteúdo prejudicial passa, às vezes prompts comuns são bloqueados; uma reclamação amplamente compartilhada no r/grok resumiu assim: "a geração de imagem está arruinada, até biquínis estão sendo censurados". Um aperto no paywall em abril de 2026 também derrubou bastante a avaliação do aplicativo. Além do histórico de moderação, o consenso da comunidade é que o Grok continua mais fraco em programação que o Claude ou o ChatGPT, consistente com sua pontuação de 86,6% no SWE-bench mencionada acima.
Onde uma ferramenta específica de documentos ainda vence os quatro
Nenhum desses quatro assistentes gerais foi construído principalmente para responder a partir de um conjunto fixo dos seus próprios documentos com um rastro de citação de volta à passagem exata. Esse é um trabalho diferente do que eles foram otimizados para fazer, e isso aparece: o ChatGPT e o Grok respondem majoritariamente a partir do conhecimento de treinamento mais o que você cola; o Claude e o Gemini conseguem receber envios grandes, mas não fazem da citação por afirmação o comportamento padrão do produto. Se seu trabalho real é pesquisa de fonte fechada (uma pilha de PDFs, um conjunto de leituras de curso, uma pasta de transcrições de reunião) em que você precisa que toda afirmação seja rastreável a uma linha específica num documento específico, o Gemini Notebook (o produto antes conhecido como NotebookLM, rebatizado pelo Google em julho de 2026) foi construído exatamente em torno dessa restrição de um jeito que nenhum dos quatro assistentes gerais acima consegue igualar. Não é um substituto para nenhum deles em escrita aberta ou programação. É uma ferramenta diferente para um trabalho diferente, e um fluxo de trabalho razoável usa os dois: verifique fatos numa ferramenta fundamentada e centrada em citações, depois leve a síntese verificada para qualquer assistente geral que se encaixe na tarefa de escrita ou análise em questão.
Perguntas frequentes
Qual IA é a melhor no geral em 2026?
Não existe uma. Essa é a resposta honesta, não uma esquiva. O Claude lidera atualmente em programação e qualidade de escrita longa, o Grok é o único com acesso nativo em tempo real a eventos atuais, e o Gemini e o ChatGPT lideram em geração de imagem. Escolha com base na sua tarefa principal, não numa única pontuação agregada.
Qual IA é a melhor para programação agora?
O Claude Opus 5 lidera no SWE-bench Verified com 96-97%, verificado de forma independente pela vals.ai em 97,0%. O GPT-5.6 Sol vem logo atrás com 96,2%, próximo o suficiente para que a vantagem de reputação do Claude nas comunidades de programação não seja puramente sobre o número do benchmark, mas também sobre ferramentas como o Claude Code. O Gemini é consistentemente descrito como o mais fraco dos quatro em programação, útil como uma segunda opinião em vez de ferramenta principal.
Qual IA é totalmente gratuita para usar?
Todas as quatro têm um plano gratuito: o Claude usa o Sonnet 5 por padrão, o ChatGPT usa o GPT-5.6 Luna por padrão com chat de texto ilimitado desde 6 de agosto de 2026, o Gemini tem um plano gratuito limitado, e o Grok é acessível pelo menos pelo plano X Premium de $8/mês para acesso completo (o plano básico gratuito do X inclui acesso limitado ao Grok). Nenhum dos planos gratuitos chega ao modelo de ponta real de cada fornecedora.
Qual IA tem a maior janela de contexto?
No papel, o Claude Fable 5 e o Mythos 5 vêm com 1M de tokens por padrão, igualando a janela de entrada de 1M do Gemini 3.1 Pro. Na prática, o produto de chat para consumidores do Gemini supostamente tem teto de memória de trabalho real em torno de 16.000 tokens, segundo o Android Headlines. A janela completa funciona no produto Google AI Studio voltado a desenvolvedores, mas não de forma consistente no aplicativo para consumidores, então trate o número anunciado com cautela para uso de chat do dia a dia.
Qual IA consegue acessar informações em tempo real e as notícias de hoje?
O Grok, sem dúvida: seu acesso nativo a dados do X/Twitter é um diferencial que toda fonte que cobre esse espaço concorda existir. O Claude não tem acesso nativo em tempo real e depende de uma ferramenta opcional de busca na web. O ChatGPT tem navegação na web, mas avaliadores a descrevem como menos fluida que a integração nativa do Grok.
Qual é a diferença entre o GPT-5.6 Sol, Terra e Luna?
O Sol é o modelo de ponta da OpenAI (cerca de $5/$30 por milhão de tokens, precisa do Plus ou superior), o Terra é o cavalo de trabalho intermediário (cerca de $2/$12 por milhão), e o Luna é o modelo rápido e barato (cerca de $0,20/$1,20 por milhão) que é o padrão do plano gratuito com chat de texto ilimitado desde 6 de agosto de 2026. Usuários do plano gratuito estão conversando com o Luna, não com o Sol.
O Claude Opus 5 é melhor que o Claude Fable 5?
Depende do que você precisa. O Opus 5 ($5/$25 por milhão) é o modelo de ponta de uso cotidiano e o que entrega as maiores pontuações de programação no SWE-bench, pela metade do preço do Fable 5/Mythos 5 ($10/$50 por milhão). O Fable 5 e o Mythos 5 vêm com uma janela de contexto maior de 1M de tokens por padrão e podem gerar até 128K tokens por resposta, parte do nível que a própria Anthropic declara como "o mais capaz lançado amplamente". O uso cotidiano em geral é melhor atendido pelo Opus 5; recorra ao Fable 5 ou ao Mythos 5 especificamente quando precisar do contexto maior ou do teto de saída maior.