GPT-4o (OpenAI)
A OpenAI revela o GPT-4o, modelo « omni » que processa nativamente texto, áudio e imagem em tempo real, mais rápido e mais barato do que o GPT-4.
Pontos-chave
- A OpenAI revela o GPT-4o a 13 de maio de 2024, um modelo omni que gere nativamente texto, áudio e imagem.
- Tratamento em tempo real, latência reduzida, custo inferior ao GPT-4.
- Interações de voz e visuais fluidas, próximas de uma conversa natural.
- Acelera a adoção dos assistentes de IA nos usos quotidianos e móveis.
Análise
O GPT-4o reduz o custo e a latência ao mesmo tempo que unifica as modalidades, o que torna os assistentes de IA mais naturais de usar no dia a dia, nomeadamente por voz. Esta fluidez alarga os momentos e os contextos em que as pessoas interrogam uma IA em vez de um motor clássico.
Para a visibilidade, a ascensão das interações de voz e multimodais reforça a importância de uma resposta única e bem formulada: na oralidade, há muitas vezes uma só resposta restituída, sem lista de ligações. Ser a fonte escolhida torna-se ainda mais crítico do que na pesquisa textual.
O que fazer
- Otimizar para respostas diretas e concisas às perguntas naturais, formuladas como se colocam na oralidade.
- Estruturar os dados factuais (horários, preços, contactos, definições) para que sejam facilmente restituídos em contexto de voz ou sintético.
- Acompanhar a presença da sua marca nas respostas multimodais e de voz, e não apenas nos resultados escritos.
Interações por voz e visuais fluidas. Aceleração da adoção dos assistentes de IA no quotidiano.