jsonscraper

Cloudflare lance Clef-omni pour analyser l’audio et la vidéo de façon structurée

Le modèle traite du texte, des images, de l’audio et de la vidéo, puis évalue les réponses selon un schéma défini. Dans la même mise à jour, Cloudflare a baissé le prix de Clef-flash hébergée et réduit la fenêtre de contexte de sa version hébergée.

Politique éditoriale Signaler une erreur

Vérifier en une seule requête si une étiquette est lisible sur une photo, si un ventilateur fonctionne dans une vidéo et si un bruit parasite est audible dans un enregistrement audio : voici l’exemple que Cloudflare donne pour son nouveau modèle Clef-omni. Le 9 octobre 2026, l’entreprise a annoncé son lancement : le modèle accepte du texte, des images, de l’audio et de la vidéo, puis évalue des réponses possibles à des questions définies.

Article : Cloudflare lance Clef-omni pour analyser l’audio et la vidéo de façon structurée
Résumé : Le 9 octobre, Cloudflare a annoncé Clef-omni, un modèle à poids ouverts conçu pour prendre des décisions structurées à partir de texte, d’images, d’audio et de vidéo. L’entreprise a également réduit le prix de Clef-flash hébergée, de 0,09 $ à 0,038 $ par million de jetons d’entrée, et ramené sa fenêtre de contexte de 64 000 à 24 000 jetons.
Rôle de l’image : couverture — l’idée centrale
Section : 
Sujet visuel : Inspection d’équipements industriels avec
© jsonscraper · Illustration générée par IA

Clef-omni prolonge la famille de modèles de prise de décision Clef, présentée par Cloudflare la semaine précédente. Le développeur définit un schéma de questions et de réponses autorisées ; le modèle renvoie des scores pour ces réponses, exploitables dans un traitement structuré. Cela convient à la classification de demandes et de contenus multimédias lorsque le résultat doit être transmis à une application ou à un flux de travail.

Un même schéma pour différents types de données en entrée

Dans son annonce de Clef-omni, Cloudflare décrit un modèle fondé sur Qwen3-Omni-30B-A3B-Instruct et doté d’une architecture de type mixture of experts. Il prend en charge le texte et JSON, les images, les formats WAV et MP3 pour l’audio, ainsi que MP4 et WebM pour la vidéo. Pour chaque question à choix multiples, le modèle attribue des scores aux réponses possibles ; l’application peut ainsi traiter le résultat dans un format prédéfini.

Par exemple, lors du tri de signalements de pannes, une équipe peut poser des questions sur la lisibilité d’une étiquette sur une photo, la présence de bruit dans un enregistrement et le clignotement d’un voyant dans une vidéo. Une même requête rassemble ces éléments multimodaux dans une réponse structurée, destinée à être acheminée vers l’étape suivante.

Cloudflare indique une latence médiane d’environ 130 ms pour les décisions fondées sur du texte et d’environ 150 ms pour celles fondées sur des images. Pour une vidéo de 21 secondes avec du son, l’entreprise annonce environ 1,5 seconde. Il s’agit de résultats issus des tests publiés par l’entreprise ; pour évaluer son propre système, il faut aussi tenir compte des fichiers, du schéma de questions et du mode de déploiement.

Poids ouverts et exécution dans le cloud

Cloudflare a publié les poids de Clef-omni sur Hugging Face sous licence Apache-2.0. La fiche du modèle décrit une exécution locale et des tests sur un seul accélérateur H200 ; pour la configuration bfloat16, elle indique environ 64 Go de mémoire vidéo. Les équipes peuvent ainsi évaluer l’auto-hébergement en tenant compte du matériel et de la configuration nécessaires.

À l’intérieur de la passerelle LoRa intelligente Nebra
Pi Supply · Licence Unsplash

Pour Clef-omni dans le cloud, Cloudflare a annoncé un tarif de 0,15 $ par million de jetons d’entrée. Le coût dépend du contenu fourni : Cloudflare explique séparément comment les images et l’audio sont convertis en jetons facturables, tandis que la vidéo influe également sur le volume des données d’entrée. Avant d’établir un budget, il convient de vérifier les conditions en vigueur dans la documentation de Workers AI.

Clef-flash coûte moins cher, mais le contexte de sa version cloud est réduit

Dans la même mise à jour, Cloudflare a abaissé le prix de Clef-flash hébergée, de 0,09 $ à 0,038 $ par million de jetons d’entrée. La fenêtre de contexte de la version hébergée a simultanément été réduite de 64 000 à 24 000 jetons. Selon l’entreprise, seuls 0,24 % des requêtes dépassaient le nouveau seuil.

Avant de profiter du tarif réduit, les équipes ont intérêt à vérifier la longueur de leurs requêtes et documents réels. Les poids publiés de Clef-flash n’ont pas changé : Cloudflare précise que, pour l’auto-hébergement, le modèle est conçu pour un contexte pouvant atteindre 256 000 jetons. Cette limite concerne la version à poids ouverts, et non la version cloud, dont la fenêtre est de 24 000 jetons.

L’intérêt pratique de Clef-omni est de réunir une entrée multimodale et le choix parmi des réponses prédéfinies dans une seule requête. Les équipes qui classent des contenus, rapprochent du son et des images ou remplissent des champs fixes peuvent l’évaluer à partir de leurs propres exemples. Pour choisir entre le cloud et l’installation autonome, il faut tenir compte séparément du tarif, du matériel requis et de la longueur de contexte nécessaire.

People

No people listed for this article yet.

Keep readingGoogle ouvre SynthID Detector pour vérifier les images, vidéos et fichiers audio
Read the next article

Transformez vos lectures en intégration fonctionnelle

Explorez les API de données sociales de jsonscraper, testez des requêtes et créez votre prochain workflow.

Explorer les API