jsonscraper

Cloudflare lança Clef-omni para análise estruturada de áudio e vídeo

O modelo processa texto, imagens, áudio e vídeo e, em seguida, avalia respostas segundo um esquema definido. Na mesma atualização, a Cloudflare reduziu o preço da Clef-flash hospedada e diminuiu o contexto da versão oferecida pela empresa.

Política editorial Comunique um erro

Verificar em uma única solicitação se o rótulo em uma foto está legível, se um ventilador está funcionando em um vídeo e se há ruído estranho em uma gravação de áudio — esse é um exemplo que a Cloudflare apresenta para o novo modelo Clef-omni. Em 9 de outubro de 2026, a empresa anunciou seu lançamento: o modelo aceita texto, imagens, áudio e vídeo e avalia opções de resposta para perguntas definidas.

Artigo: Cloudflare lança Clef-omni para análise estruturada de áudio e vídeo
Resumo: Em 9 de outubro, a Cloudflare anunciou o lançamento da Clef-omni, um modelo de pesos abertos para decisões estruturadas sobre texto, imagens, áudio e vídeo. A empresa também reduziu o preço da Clef-flash hospedada de US$ 0,09 para US$ 0,038 por milhão de tokens de entrada e diminuiu sua janela de contexto de 64 mil para 24 mil tokens.
Função da imagem: capa — a ideia central
Seção: 
Tema visual: Inspeção de equipamento industrial com
© jsonscraper · Ilustração gerada por IA

A Clef-omni dá continuidade à família de modelos de tomada de decisão Clef, apresentada pela Cloudflare na semana anterior. O desenvolvedor define um esquema de perguntas e respostas permitidas; o modelo retorna pontuações para essas opções, adequadas ao processamento estruturado. Isso é útil para classificar solicitações e materiais multimídia quando o resultado precisa ser encaminhado a um aplicativo ou fluxo de trabalho.

Um único esquema para diferentes tipos de entrada

No anúncio da Cloudflare sobre a Clef-omni, o modelo é descrito como baseado no Qwen3-Omni-30B-A3B-Instruct, com arquitetura mixture-of-experts. Ele oferece suporte a texto e JSON, imagens, WAV e MP3 para áudio, além de MP4 e WebM para vídeo. Para cada pergunta com opções de resposta, o modelo pontua as alternativas; assim, o aplicativo pode processar o resultado em um formato predefinido.

Por exemplo, ao classificar solicitações de reparo, uma equipe pode fazer perguntas sobre a legibilidade do rótulo na foto, ruídos na gravação e o piscar de um indicador no vídeo. Uma única solicitação combina evidências multimodais em uma resposta estruturada para encaminhamento posterior.

A Cloudflare informa uma latência mediana de cerca de 130 ms para decisões baseadas em texto e de aproximadamente 150 ms para imagens. Para um vídeo de 21 segundos com áudio, a empresa indica cerca de 1,5 segundo. Esses são resultados dos testes divulgados pela empresa; para avaliar um sistema próprio, também importam os arquivos, o esquema de perguntas e o método de implantação.

Pesos abertos e execução na nuvem

A Cloudflare publicou os pesos da Clef-omni no Hugging Face sob a licença Apache-2.0. O cartão do modelo descreve a execução local e os testes em um único acelerador H200; para a configuração bfloat16, são indicados cerca de 64 GB de memória de vídeo. Isso permite que as equipes avaliem a hospedagem própria considerando os requisitos de hardware e configuração.

Interior do gateway LoRa inteligente Nebra
Pi Supply · Licença Unsplash

Para a Clef-omni na nuvem, a Cloudflare anunciou o preço de US$ 0,15 por milhão de tokens de entrada. O cálculo depende da composição da entrada: a Cloudflare explica separadamente como imagens e áudio são convertidos em tokens faturáveis, e o vídeo também afeta o volume de dados de entrada. Antes de calcular o orçamento, consulte as condições atuais na documentação do Workers AI.

Clef-flash fica mais barata, mas o contexto da versão na nuvem diminui

Na mesma atualização, a Cloudflare reduziu o preço da Clef-flash hospedada de US$ 0,09 para US$ 0,038 por milhão de tokens de entrada. A janela de contexto da versão hospedada também diminuiu de 64 mil para 24 mil tokens. Segundo a empresa, apenas 0,24% das solicitações ultrapassavam o novo limite.

Antes de migrar para o preço mais baixo, as equipes devem verificar o tamanho real das solicitações e dos documentos. Os pesos publicados da Clef-flash não mudaram: a Cloudflare informa que, quando hospedado por conta própria, o modelo suporta um contexto de até 256 mil tokens. Esse limite se aplica à versão aberta, não à versão na nuvem, cuja janela é de 24 mil tokens.

A proposta prática da Clef-omni é combinar entrada multimodal e seleção entre opções predefinidas em uma única solicitação. Produtos que classificam materiais, comparam som e imagem ou preenchem campos fixos podem ser avaliados com exemplos próprios. Ao escolher entre a instalação na nuvem e a hospedagem própria, é preciso considerar separadamente o preço, os requisitos de hardware e o tamanho de contexto necessário.

People

No people listed for this article yet.

Keep readingGoogle abre o SynthID Detector para verificar imagens, vídeos e áudio
Read the next article

Transforme o que lê numa integração funcional

Explore as APIs de dados sociais da jsonscraper, teste pedidos e crie o seu próximo fluxo de trabalho.

Explorar APIs