Comprobar de una sola vez si se lee la etiqueta de una foto, si funciona el ventilador en un vídeo y si se oye un ruido extraño en una grabación de audio: ese es el ejemplo que Cloudflare presenta para su nuevo modelo Clef-omni. El 9 de octubre de 2026, la empresa anunció su lanzamiento: el modelo admite texto, imágenes, audio y vídeo, y evalúa opciones de respuesta a preguntas definidas.

Clef-omni amplía la familia de modelos de toma de decisiones Clef, que Cloudflare presentó la semana anterior. El desarrollador define un esquema de preguntas y respuestas permitidas; el modelo devuelve puntuaciones para esas opciones, aptas para un procesamiento estructurado. Esto resulta útil para clasificar consultas y materiales multimedia cuando hay que enviar el resultado a una aplicación o flujo de trabajo.
Un mismo esquema para distintos tipos de entrada
En el anuncio de Cloudflare sobre Clef-omni, se describe el modelo como basado en Qwen3-Omni-30B-A3B-Instruct y con una arquitectura de mezcla de expertos (mixture-of-experts). Admite texto y JSON, imágenes, WAV y MP3 para audio, y MP4 y WebM para vídeo. Para cada pregunta con opciones de respuesta, el modelo puntúa las opciones; así, la aplicación puede procesar el resultado en un formato predefinido.
Por ejemplo, al clasificar informes de averías, un equipo puede formular preguntas sobre si se lee la etiqueta en una fotografía, si hay ruido en una grabación y si parpadea un indicador en un vídeo. Una única consulta combina esas señales multimodales en una respuesta estructurada que permite dirigir el caso al destino adecuado.
Cloudflare informa de una latencia mediana de unos 130 ms para decisiones basadas en texto y de unos 150 ms para imágenes. Para un vídeo de 21 segundos con sonido, la empresa indica aproximadamente 1,5 segundos. Son resultados de pruebas comunicados por la propia empresa; para evaluar un sistema propio también importan sus archivos, el esquema de preguntas y el método de despliegue.
Pesos abiertos y ejecución en la nube
Cloudflare publicó los pesos de Clef-omni en Hugging Face con licencia Apache-2.0. La ficha del modelo describe cómo ejecutarlo y probarlo localmente en un acelerador H200; para la configuración bfloat16, indica que se necesitan unos 64 GB de memoria de vídeo. Esto permite a los equipos evaluar el alojamiento propio teniendo en cuenta los requisitos de hardware y configuración.
Para Clef-omni en la nube, Cloudflare anunció un precio de 0,15 dólares por millón de tokens de entrada. El cálculo depende de la composición de la entrada: Cloudflare explica por separado cómo se convierten las imágenes y el audio en tokens facturables, y el vídeo también influye en el volumen de datos de entrada. Antes de calcular el presupuesto, conviene consultar las condiciones vigentes en la documentación de Workers AI.
Clef-flash baja de precio, pero se reduce el contexto de la versión en la nube
En la misma actualización, Cloudflare redujo el precio de Clef-flash alojado de 0,09 a 0,038 dólares por millón de tokens de entrada. La ventana de contexto de la versión alojada también se redujo de 64.000 a 24.000 tokens. Según la empresa, solo el 0,24 % de las consultas superaba el nuevo límite.
Antes de pasarse al precio más bajo, los equipos deberían comprobar la longitud real de sus consultas y documentos. Los pesos publicados de Clef-flash no han cambiado: Cloudflare indica que, en alojamiento propio, el modelo admite un contexto de hasta 256.000 tokens. Ese límite corresponde a la versión abierta, no a la versión en la nube, cuya ventana es de 24.000 tokens.
La idea práctica de Clef-omni es combinar en una sola consulta entradas multimodales y la selección entre opciones predefinidas. Los productos que clasifican materiales, relacionan sonido e imagen o rellenan campos fijos pueden evaluarlo con ejemplos propios. Al elegir entre la nube y la instalación propia, conviene tener en cuenta por separado el precio, los requisitos de hardware y la longitud de contexto necesaria.