Pular para o conteúdo
← Voltar para o Skalablog

Artigo publicado

Como comparar DeepSeek V4.1 Flash vs GPT-6 Astra

Engenharia de SoftwareChatGPTNotion

Quatro builds somaram US$ 118,16 de API para o GPT-6 Astra e US$ 20,20 para o DeepSeek V4.1 Flash, uma diferença de quase seis vezes. O comparativo DeepSeek V4.1 Flash vs GPT-6 Astra também mediu o tempo total: 14h52 contra 5h30.

DeepSeek V4.1 Flash vs GPT-6 Astra: o que o teste mede

O comparativo DeepSeek V4.1 Flash vs GPT-6 Astra coloca os dois modelos para construir quatro projetos reais com o mesmo prompt inicial, medindo qualidade visual, funcionalidade, custo de API, tempo de build e capacidade de corrigir o que o usuário reclama. O autor do vídeo, Bart Slodyczka, testou DeepSeek V4.1 Flash e GPT-6 Astra entre 1 e 16 de setembro de 2026, sempre pela API paga do OpenRouter, para poder medir custo por token e tempo real de execução.

Os quatro projetos foram: um jogo estilo Age of Empires com construção de vila e combate, um site com animação controlada por scroll, um app de agendamento para barbearia com banco SQLite e um modelo 3D de caminhonete no Blender. Cada projeto recebeu de duas a quatro rodadas de feedback, e as duas ferramentas usaram o mesmo canal de geração de mídia: o Higgsfield com o modelo Seedance 2.5.

A metodologia separa claramente o que é gasto de modelo e o que é gasto de mídia. Os custos de API dos dois modelos vieram do OpenRouter, enquanto os créditos do Higgsfield foram contabilizados à parte, o que permite comparar o custo real de raciocínio contra o custo de gerar imagem e vídeo.

Uma ressalva metodológica importante: o autor cita "ChatGPT Imagens 2.5" e uma skill de imagens que não usou no primeiro teste do Astra, e menciona que o modelo falou "Notion" em uma das cenas. Ambos são ecos do texto-fonte, não nomes técnicos confirmados de produto, e devem ser tratados com cautela.

Age of Empires: onde o GPT-6 Astra foi superior

No primeiro teste, o jogo estilo Age of Empires, o GPT-6 Astra entregou a melhor primeira versão: interface mais bonita, menu funcional, fog of war, linha de destino das unidades e UI com ícones de status. Na primeira tentativa o Astra já tinha controle de neblina sobre o mapa, barra de recursos, exclusão de double booking e feedback visual das ações.

A evolução em três versões mostrou o padrão de cada modelo. O Astra custou US$ 12,25 e levou 47 minutos para as três versões, com US$ 3,30 do lado do DeepSeek em 4h14 de build no total. Segundo o autor, a primeira versão do Astra foi mais "pronta para jogar" e as checagens internas do DeepSeek geraram mais ciclos de depuração, o que esticou o tempo.

Analisando as porcentagens diretas: 47 minutos contra 4h14 representam cerca de 5,4x mais tempo para o DeepSeek. Em valor absoluto, a diferença de custo de US$ 8,95 é pequena no contexto de um teste; a diferença de tempo é o fator que mais pesou na escolha do autor, que declarou o Astra vencedor deste teste.

O resultado é específico deste teste, com o mesmo prompt e o mesmo ambiente de execução. Não se pode generalizar a partir de um único jogo.

Em relação ao preço, o autor também cita no vídeo um comparativo entre "Fable e Astra", mas esses nomes não correspondem a nenhum produto que possa ser verificado publicamente. Considere o trecho apenas como uma referência interna do criador do vídeo.

Site com scroll: DeepSeek 6x mais barato

No segundo teste, um site com animação controlada por scroll e frames de vídeo, o DeepSeek foi cerca de seis vezes mais barato: US$ 7,74 contra US$ 48,63 do Astra, com tempo de build de 7h30 contra 2h10. O autor declarou empate, com uma ressalva clara: para uso próprio ele escolheria o DeepSeek, mas para uma agência de produção de sites ele preferiria o Astra por causa da velocidade.

Os defeitos foram diferentes. O DeepSeek travou no efeito de scrub: em um dos frames a animação pulou de 198 para 264 em um único scroll, porque o modelo cortou frames em blocos irregulares em vez de remover um a cada dois ou três para manter consistência. O Astra começou pior, sem vídeo nenhum, porque o conector do Higgsfield não estava configurado na sessão.

A correção de rota do Astra é a parte mais instrutiva do teste: o modelo precisou de apenas uma iteração para trazer um vídeo e depois converteu bem as imagens em hover. O DeepSeek só chegou em um resultado aceitável na quarta versão, com nota autoatribuída de 6 a 7 de 10 pelo próprio autor, e ainda deixou problemas de alinhamento no layout mobile.

O bloco mobile ficou fraco nos dois. Nenhum dos sites estava pronto para mobile na primeira versão, e as duas versões precisaram de prompts extras para empilhar melhor as colunas e corrigir o menu hambúrguer. A conclusão do autor é que o resultado final é utilizável em ambos, mas que os dois ainda pediriam mais uma rodada de conversa.

App de agendamento: DeepSeek 8x mais barato

No terceiro teste, um sistema de agendamento para barbearia com banco SQLite e área de staff, o DeepSeek ganhou com folga: US$ 2,33 e uma hora de runtime contra US$ 17,88 e 41 minutos do Astra. A diferença de preço foi de aproximadamente 7,7x, e os dois apps entregaram a mesma funcionalidade ponta a ponta.

Os recursos testados foram concretos: marcar corte com o barbeiro Alex na quarta-feira 16 às 10h15, receber um link privado de gerenciamento, tentar double booking no mesmo horário — bloqueado corretamente, com o slot removido da grade. No modo staff, era possível bloquear períodos de indisponibilidade, ver os agendamentos do dia, cancelar e ver o status refletido na tela do cliente.

A diferença de preço ficou grande porque este app era simples, sem geração de mídia pesada. O autor observou que, nesse caso, o tempo foi praticamente igual entre os dois modelos e a diferença de design foi pequena; por isso o DeepSeek venceu sem discussão.

O app do Astra tinha UI mais atraente, com ícones e uma imagem de destaque, mas a tabela do painel de staff exigia rolagem horizontal no mobile. Esse detalhe mostra que a diferença de qualidade ficou principalmente estética, não funcional.

Blender: detalhe do Astra contra custo do DeepSeek

No quarto teste, modelagem de uma caminhonete no Blender com câmera percorrendo a carroceria, o Astra entregou o modelo mais detalhado, com pinças de freio, raios de roda e drivetrain visíveis já no primeiro prompt, enquanto o DeepSeek ficou mais barato: US$ 4,66 contra US$ 39,64, uma diferença de cerca de 8,5x. O tempo total foi parecido, 2h12 contra 1h48.

O autor usou o conector do Higgsfield dentro do Blender nos dois casos, com o Seedance 2.5 para converter as cenas em vídeo. O resultado preferido foi o do DeepSeek, porque a cena no outback australiano tinha faróis auxiliares, antena e relevo irregular, elementos coerentes com o ambiente, o que faz dela um B-roll útil para anúncios.

Para o Astra, o destaque foi o nível de detalhe do compartimento do motor: reservatórios de fluido, baterias, amortecedores do capô e trava. O autor diz que, se fosse engenheiro de uma montadora, escolheria o Astra apenas por essa capacidade de detalhe, mesmo com o custo maior.

Vale fechar o ponto com precisão: o resultado do teste de Blender é uma preferência do autor, não uma medida objetiva de qualidade. O Astra ganhou em detalhe, o DeepSeek ganhou em custo, e o veredito final do autor foi o DeepSeek.

Custo, tokens e tempo: os números totais

Somando os quatro testes, o GPT-6 Astra custou US$ 118,16 em API, consumiu 58,6 milhões de tokens, fez 511 requisições e levou cerca de 5h30 de build. O DeepSeek V4.1 Flash custou US$ 20,20 em API, consumiu algo em torno de 300 milhões de tokens, fez cerca de 1.120 requisições e levou aproximadamente 14h52. O gasto em créditos do Higgsfield ficou próximo entre os dois.

Atenção ao trecho sobre tokens: o texto-fonte diz "60 milhões" e "300" e depois chama a diferença de cinco vezes. A conta direta não fecha com clareza, então use como referência principal o custo por API, não a contagem de tokens. O ponto que se sustenta é a diferença de preço total, de aproximadamente seis vezes a favor do DeepSeek, com um tempo de build cerca de três vezes maior.

Segundo o autor, há um vencedor diferente por cenário. DeepSeek venceu no app de agendamento e no Blender; Astra venceu no jogo e houve empate no site. O resultado mostra que a escolha entre custo e velocidade depende do projeto, não de um campeão absoluto.

Abaixo, o resumo por teste com as dimensões que o vídeo efetivamente comparou.

FAQ

  • DeepSeek V4.1 Flash é mais barato que o GPT-6 Astra? Sim, no teste do canal Bart Slodyczka o DeepSeek custou cerca de seis vezes menos no total: US$ 20,20 em API contra US$ 118,16 do Astra, somando os quatro builds. A diferença por teste variou entre 6x no site e cerca de 10x no Blender.
  • Qual dos dois modelos foi mais rápido? O GPT-6 Astra foi mais rápido em três dos quatro testes, com cerca de 5h30 totais contra aproximadamente 14h52 do DeepSeek. No app de agendamento os dois praticamente empataram em tempo.
  • Qual modelo ganhou o teste do jogo estilo Age of Empires? O GPT-6 Astra venceu, com UI mais polida, menu funcional, fog of war e status de aldeão, e sem double booking de comandos. O Astra custou US$ 12,25 e levou 47 minutos nas três versões, contra US$ 3,30 em 4h14 do DeepSeek.
  • Quem ganhou o teste do site com animação de scroll? O autor declarou empate: o Astra ficou visualmente melhor, cerca de 10% a 20% segundo ele, mas o DeepSeek custou US$ 7,74 contra US$ 48,63 do Astra. Para uso próprio ele escolheria o DeepSeek; em agência, o Astra.
  • E o app de agendamento de barbearia, quem ganhou? O DeepSeek venceu sem discussão. Ambos entregaram a mesma funcionalidade — marcar, cancelar e gerenciar horários no painel de staff — por US$ 2,33 contra US$ 17,88, uma diferença de cerca de 7,7x.
  • Qual modelo modelou melhor a caminhonete no Blender? O GPT-6 Astra entregou mais detalhe, incluindo pinças de freio e compartimento do motor, mas o autor preferiu a cena final do DeepSeek pelo contexto do outback australiano. O DeepSeek custou US$ 4,66 contra US$ 39,64, cerca de 8,5x mais barato.
  • Os dois modelos receberam o mesmo prompt? Sim, cada build partiu do mesmo prompt inicial e passou pelas mesmas rodadas de feedback. As iterações foram feitas em número diferente, o que é uma das limitações metodológicas do teste.
  • Dá para usar os resultados para decidir uma assinatura? Não diretamente. O teste reflete um ambiente, um período e um conjunto específico de quatro projetos, e mistura custo de raciocínio com custo de geração de mídia externa. Trate os números como evidência de primeira mão do autor do vídeo.
  • Quem pode usar o Skala Blog e a Crazystack Typescript nesse tipo de projeto? Desenvolvedores que querem transformar vídeos e experimentos em conteúdo escrito usam o Skala Blog; quem quer aprender a estruturar projetos em TypeScript pode acompanhar a Crazystack Typescript, plataforma do Gustavo Dev Doido que também tem o Bootcamp do Dev Doido como trilha de formação.

Source video