Lançamento · Anthropic
Haiku 5.5 barateia tarefas curtas, mas cobra cinco vezes mais depois de 100 mil tokens
O modelo está disponível nas plataformas da Anthropic e em nuvens parceiras; a nova faixa de preço favorece volume e baixa latência, não conversas longas sem controle.
A Anthropic lançou o Claude Haiku 5.5 para classificação, resumo, extração, atendimento e subtarefas de agentes. Em prompts de até 100 mil tokens, custa US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de saída. Acima desse limite, os valores sobem para US$ 0,50 e US$ 2,50. O modelo está disponível, mas a economia depende de medir o contexto total de cada tarefa.
- Acontecimento
- Publicação
- Última revisão
- Leitura
- 4 min
O que aconteceu
A Anthropic apresentou o Claude Haiku 5.5 em 7 de outubro e o colocou em disponibilidade geral no Claude Platform, Amazon Web Services, Google Cloud e Microsoft Azure. O identificador de API é claude-haiku-5-5. A empresa posiciona o modelo para tarefas rápidas e repetitivas, como resumo, compactação de histórico, consultas a banco, classificação, atendimento ao vivo e uso de navegador.
O estágio é disponível, não beta nem preview. Isso permite teste e contratação imediatos, mas não elimina a necessidade de confirmar região, contrato, retenção de dados e recursos efetivamente oferecidos por cada nuvem parceira.
O que mudou
O preço agora depende do tamanho do prompt. Até 100 mil tokens, a Anthropic cobra US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de saída. Acima de 100 mil, cobra US$ 0,50 pela entrada e US$ 2,50 pela saída. Leituras de cache custam US$ 0,01 ou US$ 0,05, e gravações custam US$ 0,125 ou US$ 0,625, conforme a mesma faixa.
O Haiku 5.5 aceita texto e imagem como entrada, produz texto, oferece janela de contexto declarada de um milhão de tokens, saída de até 128 mil tokens e ajuste de esforço. A própria Anthropic recomenda os modelos Sonnet e Opus para tarefas agentivas de programação mais complexas.
Por que importa
A arquitetura de um fluxo passa a importar tanto quanto a escolha do modelo. Classificar pedidos, localizar trechos, preencher campos, resumir uma reunião e preparar contexto para um modelo maior podem ser executados por um modelo pequeno, desde que cada etapa tenha escopo, evidência e critério de saída claros.
O limiar de 100 mil tokens muda a conta. Histórico acumulado, anexos extensos, resultados de busca e respostas de ferramentas entram no prompt. Sem compactação e roteamento, um agente pode sair da faixa econômica sem que o usuário perceba.
Para quem importa
Equipes com grande volume de chamados, documentos, registros, pesquisas internas e tarefas previsíveis podem encontrar uma alternativa de baixo custo. Também interessa a quem constrói agentes com um modelo principal e vários subagentes especializados em busca, triagem, extração e verificação.
Para análises ambíguas, decisões de alto impacto, sínteses com muitas fontes ou programação agentiva longa, o preço inicial não deve ser o critério dominante. Nesses casos, compare qualidade final, taxa de correção humana e custo total da tarefa com modelos maiores.
Impacto prático
A Anthropic afirma que o Haiku 5.5 custa, em média, cerca de 75% menos que o Haiku 4.5. Também publica resultados próprios superiores ao antecessor em trabalho de conhecimento, uso de computador, raciocínio visual e programação agentiva. Esses números são do fornecedor e variam com esforço, ferramentas, amostra e forma de contagem.
A avaliação independente da Artificial Analysis encontrou bom rendimento por segundo e um índice geral abaixo do Sonnet 5.5, além de consumo elevado de tokens de raciocínio em alguns cenários. O conjunto ajuda a contestar a ideia de que velocidade e preço por token, isoladamente, determinam o custo por tarefa.
O que testar
Escolha três tarefas curtas e repetíveis, como classificar cem solicitações, extrair campos de cinquenta documentos e resumir conversas de atendimento. Use um conjunto com respostas conhecidas e compare precisão, falsos positivos, latência, tokens de entrada e saída, custo e tempo de revisão humana.
Depois repita o teste com contexto crescente. Meça o ponto em que histórico e anexos cruzam 100 mil tokens e avalie compactação, busca por trechos e divisão em etapas. O objetivo é descobrir se a economia permanece na tarefa completa, não apenas na chamada individual.
O que observar
Acompanhe estabilidade de preço, limites por provedor, disponibilidade regional, compatibilidade de ferramentas e diferenças de contagem de tokens. Confirme também como cada plataforma registra prompts, usa dados para melhoria e oferece exclusão, residência e controles empresariais.
Observe falhas por excesso de confiança, recusa, perda de instruções no contexto longo e degradação em português. Um modelo rápido pode ampliar um erro com a mesma velocidade com que amplia o volume.
O que ainda não sabemos
Ainda faltam avaliações independentes amplas em português, documentos brasileiros e rotinas de arquitetura, direito, atendimento e varejo. Casos de clientes citados no anúncio são relatos selecionados pelo fornecedor, não benchmarks reproduzidos por terceiros.
Também não está demonstrado qual configuração de esforço oferece o melhor equilíbrio para cada tarefa nem como o custo de raciocínio, cache, ferramentas e correção humana se distribui em produção.
Fontes
- Claude Haiku 5.5Anthropic · Blog oficial · publicada em 7 de outubro de 2026 · conferida em 8 de outubro de 2026
- Claude Haiku 5.5 model overviewAnthropic · Documentação · conferida em 8 de outubro de 2026
- Claude Haiku 5.5 analysisArtificial Analysis · Veículo especializado · publicada em 7 de outubro de 2026 · conferida em 8 de outubro de 2026
- Anthropic launches third Claude 5.5 modelReuters · Imprensa geral · publicada em 7 de outubro de 2026 · conferida em 8 de outubro de 2026