Verificare con un’unica richiesta se un’etichetta è leggibile in una foto, se una ventola funziona in un video e se si sente un rumore anomalo in una registrazione audio: è l’esempio che Cloudflare propone per il nuovo modello Clef-omni. Il 9 ottobre 2026 l’azienda ne ha annunciato il lancio: il modello accetta testo, immagini, audio e video e valuta le opzioni di risposta in base alle domande indicate.

Clef-omni amplia la famiglia di modelli decisionali Clef, presentata da Cloudflare la settimana precedente. Lo sviluppatore definisce uno schema di domande e risposte ammissibili; il modello restituisce valutazioni delle opzioni, utilizzabili per un’elaborazione strutturata. Questo approccio è adatto a classificare richieste e materiali multimediali quando il risultato deve essere trasmesso a un’applicazione o a un flusso di lavoro.
Un unico schema per diversi tipi di input
Nell’annuncio di Cloudflare su Clef-omni, il modello è descritto come basato su Qwen3-Omni-30B-A3B-Instruct e dotato di un’architettura mixture-of-experts. Supporta testo e JSON, immagini, WAV e MP3 per l’audio, nonché MP4 e WebM per i video. Per ogni domanda a scelta multipla, il modello assegna punteggi alle opzioni, consentendo all’applicazione di elaborare il risultato in un formato prestabilito.
Per esempio, nel classificare segnalazioni di guasti, un team può formulare domande sulla leggibilità dell’etichetta in una foto, sulla presenza di rumore nella registrazione e sul lampeggiamento di una spia nel video. Un’unica richiesta riunisce così elementi multimodali in una risposta strutturata, utile per l’instradamento successivo.
Cloudflare dichiara una latenza mediana di circa 130 ms per le decisioni basate sul testo e di circa 150 ms per quelle basate sulle immagini. Per un video di 21 secondi con audio, l’azienda indica circa 1,5 secondi. Si tratta di risultati dei test dichiarati dall’azienda; per valutare un sistema specifico contano anche i file utilizzati, lo schema delle domande e le modalità di distribuzione.
Pesi aperti e distribuzione nel cloud
Cloudflare ha pubblicato i pesi di Clef-omni su Hugging Face con licenza Apache-2.0. La scheda del modello descrive l’esecuzione locale e i test su un singolo acceleratore H200; per la configurazione bfloat16 indica circa 64 GB di memoria video. Questo permette ai team di valutare l’hosting autonomo tenendo conto dei requisiti hardware e di configurazione.
Per Clef-omni nel cloud, Cloudflare ha annunciato un prezzo di 0,15 dollari per milione di token in ingresso. Il calcolo dipende dalla composizione dell’input: Cloudflare spiega separatamente come immagini e audio vengano convertiti in token fatturabili, mentre anche i video incidono sul volume dei dati in ingresso. Prima di calcolare il budget, è opportuno verificare le condizioni aggiornate nella documentazione di Workers AI.
Clef-flash costa meno, ma il contesto della versione cloud si riduce
Nello stesso aggiornamento, Cloudflare ha abbassato il prezzo di Clef-flash ospitato da 0,09 a 0,038 dollari per milione di token in ingresso. La finestra di contesto della versione ospitata è stata contestualmente ridotta da 64.000 a 24.000 token. Secondo l’azienda, solo lo 0,24% delle richieste superava la nuova soglia.
Prima di passare alla tariffa più bassa, i team dovrebbero controllare la lunghezza effettiva delle richieste e dei documenti. I pesi pubblicati di Clef-flash non sono cambiati: Cloudflare indica che, se ospitato autonomamente, il modello supporta un contesto fino a 256.000 token. Questo limite riguarda la versione aperta, non quella cloud, la cui finestra è di 24.000 token.
L’idea pratica alla base di Clef-omni è combinare input multimodali e selezione tra opzioni predefinite in un’unica richiesta. I prodotti che classificano materiali, confrontano l’audio con le immagini o compilano campi fissi possono essere valutati con esempi propri. Nella scelta tra cloud e installazione autonoma, occorre considerare separatamente la tariffa, i requisiti hardware e la lunghezza di contesto necessaria.