IA Lab by amano
Nesta entrada

Lançamento · Microsoft AI

Microsoft leva voz em tempo real ao preview com português documentado

MAI-Transcribe-2-Streaming produz transcrições parciais enquanto a pessoa fala e se conecta a novos modelos de voz; o serviço ainda não tem SLA de produção.

Em um estúdio de arquitetura, a fala de uma profissional se transforma em ondas, fragmentos de transcrição e cartões de ação antes de retornar como voz por uma pequena caixa de som.
Ilustração conceitual do ciclo de voz em tempo real. Hipóteses parciais chegam antes do fim da fala, mas precisam estabilizar antes de virar registro ou ação.

A Microsoft lançou em preview público o MAI-Transcribe-2-Streaming, seu primeiro modelo da família MAI para transcrição contínua. Ele recebe áudio em fluxo, revisa hipóteses parciais e confirma segmentos finais em 60 idiomas. Com MAI-Voice-2.1 e Flash, completa um pipeline de agentes de voz, legendas e ditado; português aparece na documentação, mas o preview não é recomendado para produção.

Acontecimento
Publicação
Última revisão
Leitura
3 min

ÁudioMultimodalidadeAgentesAPIsServiços profissionaisEducaçãoMarketingHotelariaProdutividadeConhecimentoEmpresasNegóciosAtendimentoReuniãoDocumentosAutomação

O que aconteceu

A Microsoft AI anunciou em 1º de outubro o MAI-Transcribe-2-Streaming, primeiro modelo de transcrição contínua da família MAI. No mesmo anúncio apresentou MAI-Voice-2.1 e MAI-Voice-2.1-Flash para geração de fala.

O modelo de transcrição entrou em preview público no Microsoft Foundry e no Azure Speech. A documentação é explícita: o preview não tem acordo de nível de serviço, pode ter recursos limitados e não é recomendado para cargas de produção.

O que mudou

Em vez de esperar o fim do áudio, o serviço envia resultados intermediários que mudam com o contexto e depois confirma cada segmento. A Microsoft informa suporte a 60 idiomas com detecção automática contínua e lista português entre os códigos aceitos.

Os modelos de voz suportam 23 idiomas e 26 localidades; a documentação inclui pt-BR. MAI-Voice-2.1 prioriza fidelidade e trechos longos, enquanto Flash prioriza volume e latência. LiveKit ainda aparece como disponibilidade futura.

Por que importa

Uma transcrição parcial permite que legenda, busca, resumo ou agente comecem a trabalhar enquanto a pessoa fala. Isso pode tornar atendimento e interfaces por voz mais naturais, mas também aumenta o risco de agir sobre uma hipótese que ainda será corrigida.

A presença de português na documentação abre um teste local concreto. Ela não comprova desempenho em sotaques brasileiros, ruído de obra, nomes próprios ou vocabulário técnico.

Para quem importa

Equipes de atendimento, acessibilidade, educação, reuniões, pesquisa, hospitalidade e desenvolvimento de agentes de voz. O uso exige integração por API ou SDK, portanto não é uma ferramenta pronta para transcrever qualquer reunião sem configuração.

Organizações que tratam voz como dado pessoal precisam definir consentimento, finalidade, retenção, acesso, descarte e separação entre áudio original, hipóteses parciais e transcrição final.

Impacto prático

O preço introdutório da transcrição é de US$ 0,54 por hora de áudio até o fim de 2026. MAI-Voice-2.1 custa US$ 22 por milhão de caracteres e Flash, US$ 15. Não projete esses valores para 2027 sem nova tabela.

A API Realtime limita sessões a uma hora e não fornece confiança nem timestamps por palavra. Para registros formais, guarde o resultado final e sinalize correções feitas depois do primeiro parcial.

O que testar

Crie um conjunto de áudio brasileiro com fala limpa, reunião remota, ambiente ruidoso, nomes de materiais, endereços e siglas do setor. Meça taxa de erro por palavra, tempo até o primeiro parcial, tempo até o final e número de correções entre versões.

Se houver ação automática, use apenas tarefas reversíveis no primeiro piloto. Compare agir sobre parcial, aguardar final e pedir confirmação humana; registre falsos disparos e atraso percebido.

O que observar

A Microsoft afirma primeiro lugar em precisão final e parcial no Artificial Analysis, primeiras hipóteses pouco acima de 100 milissegundos e palavras aparecendo duas vezes mais rápido que o concorrente mais próximo em avaliação interna. As duas últimas medidas são do fornecedor.

O Artificial Analysis mede cerca de oito horas em três conjuntos, ponderados por AA-AgentTalk, VoxPopuli e Earnings22. O benchmark ajuda a comparar serviços, mas não isola português brasileiro nem comprova desempenho num domínio específico.

O que ainda não sabemos

Não há SLA, data de disponibilidade geral, preço posterior a 2026 nem benchmark independente específico para pt-BR. Também não há garantia de paridade entre regiões, integrações e métodos de acesso.

Clonagem de voz exige controles de consentimento e uso. A Microsoft menciona salvaguardas embutidas, mas a documentação consultada não demonstra resistência independente a fraude, imitação indevida ou contorno desses controles.

Fontes

  1. Our first streaming transcription model debuts at no. 1 on Artificial AnalysisMicrosoft AI · Fonte oficial · publicada em 1 de outubro de 2026 · conferida em 3 de outubro de 2026
  2. MAI-Transcribe-2-Streaming overviewMicrosoft Learn · Documentação · publicada em 1 de outubro de 2026 · conferida em 3 de outubro de 2026
  3. Speech to Text AI Model and Provider LeaderboardArtificial Analysis · Veículo especializado · conferida em 3 de outubro de 2026
  4. Microsoft ships first streaming transcription model, completing voice agent pipeline in FoundryTech Times · Veículo especializado · publicada em 2 de outubro de 2026 · conferida em 3 de outubro de 2026

Conteúdos relacionados