Vérifier en une seule requête si une étiquette est lisible sur une photo, si un ventilateur fonctionne dans une vidéo et si un bruit parasite est audible dans un enregistrement audio : voici l’exemple que Cloudflare donne pour son nouveau modèle Clef-omni. Le 9 octobre 2026, l’entreprise a annoncé son lancement : le modèle accepte du texte, des images, de l’audio et de la vidéo, puis évalue des réponses possibles à des questions définies.

Clef-omni prolonge la famille de modèles de prise de décision Clef, présentée par Cloudflare la semaine précédente. Le développeur définit un schéma de questions et de réponses autorisées ; le modèle renvoie des scores pour ces réponses, exploitables dans un traitement structuré. Cela convient à la classification de demandes et de contenus multimédias lorsque le résultat doit être transmis à une application ou à un flux de travail.
Un même schéma pour différents types de données en entrée
Dans son annonce de Clef-omni, Cloudflare décrit un modèle fondé sur Qwen3-Omni-30B-A3B-Instruct et doté d’une architecture de type mixture of experts. Il prend en charge le texte et JSON, les images, les formats WAV et MP3 pour l’audio, ainsi que MP4 et WebM pour la vidéo. Pour chaque question à choix multiples, le modèle attribue des scores aux réponses possibles ; l’application peut ainsi traiter le résultat dans un format prédéfini.
Par exemple, lors du tri de signalements de pannes, une équipe peut poser des questions sur la lisibilité d’une étiquette sur une photo, la présence de bruit dans un enregistrement et le clignotement d’un voyant dans une vidéo. Une même requête rassemble ces éléments multimodaux dans une réponse structurée, destinée à être acheminée vers l’étape suivante.
Cloudflare indique une latence médiane d’environ 130 ms pour les décisions fondées sur du texte et d’environ 150 ms pour celles fondées sur des images. Pour une vidéo de 21 secondes avec du son, l’entreprise annonce environ 1,5 seconde. Il s’agit de résultats issus des tests publiés par l’entreprise ; pour évaluer son propre système, il faut aussi tenir compte des fichiers, du schéma de questions et du mode de déploiement.
Poids ouverts et exécution dans le cloud
Cloudflare a publié les poids de Clef-omni sur Hugging Face sous licence Apache-2.0. La fiche du modèle décrit une exécution locale et des tests sur un seul accélérateur H200 ; pour la configuration bfloat16, elle indique environ 64 Go de mémoire vidéo. Les équipes peuvent ainsi évaluer l’auto-hébergement en tenant compte du matériel et de la configuration nécessaires.
Pour Clef-omni dans le cloud, Cloudflare a annoncé un tarif de 0,15 $ par million de jetons d’entrée. Le coût dépend du contenu fourni : Cloudflare explique séparément comment les images et l’audio sont convertis en jetons facturables, tandis que la vidéo influe également sur le volume des données d’entrée. Avant d’établir un budget, il convient de vérifier les conditions en vigueur dans la documentation de Workers AI.
Clef-flash coûte moins cher, mais le contexte de sa version cloud est réduit
Dans la même mise à jour, Cloudflare a abaissé le prix de Clef-flash hébergée, de 0,09 $ à 0,038 $ par million de jetons d’entrée. La fenêtre de contexte de la version hébergée a simultanément été réduite de 64 000 à 24 000 jetons. Selon l’entreprise, seuls 0,24 % des requêtes dépassaient le nouveau seuil.
Avant de profiter du tarif réduit, les équipes ont intérêt à vérifier la longueur de leurs requêtes et documents réels. Les poids publiés de Clef-flash n’ont pas changé : Cloudflare précise que, pour l’auto-hébergement, le modèle est conçu pour un contexte pouvant atteindre 256 000 jetons. Cette limite concerne la version à poids ouverts, et non la version cloud, dont la fenêtre est de 24 000 jetons.
L’intérêt pratique de Clef-omni est de réunir une entrée multimodale et le choix parmi des réponses prédéfinies dans une seule requête. Les équipes qui classent des contenus, rapprochent du son et des images ou remplissent des champs fixes peuvent l’évaluer à partir de leurs propres exemples. Pour choisir entre le cloud et l’installation autonome, il faut tenir compte séparément du tarif, du matériel requis et de la longueur de contexte nécessaire.