Mit einer einzigen Anfrage prüfen, ob eine Beschriftung auf einem Foto lesbar ist, ein Ventilator auf einem Video läuft und in einer Audioaufnahme ein ungewöhnliches Geräusch zu hören ist – dieses Beispiel nennt Cloudflare für das neue Modell Clef-omni. Am 9. Oktober 2026 kündigte das Unternehmen dessen Veröffentlichung an: Das Modell nimmt Text, Bilder, Audio und Video entgegen und bewertet Antwortoptionen anhand vorgegebener Fragen.

Clef-omni erweitert die Clef-Modellfamilie für Entscheidungsaufgaben, die Cloudflare eine Woche zuvor vorgestellt hatte. Entwickler legen ein Schema mit Fragen und zulässigen Antworten fest; das Modell liefert Bewertungen der Optionen, die sich strukturiert weiterverarbeiten lassen. Das eignet sich für die Klassifizierung von Anfragen und Multimedia-Inhalten, deren Ergebnisse an eine Anwendung oder einen Workflow übergeben werden sollen.
Ein Schema für unterschiedliche Eingabetypen
In der Ankündigung von Clef-omni durch Cloudflare wird das Modell als eine auf Qwen3-Omni-30B-A3B-Instruct basierende Architektur mit Mixture of Experts beschrieben. Es unterstützt Text und JSON, Bilder, WAV- und MP3-Dateien für Audio sowie MP4 und WebM für Video. Für jede Frage mit Antwortoptionen bewertet das Modell die Optionen; so kann eine Anwendung das Ergebnis in einem vorab festgelegten Format verarbeiten.
Bei der Sortierung von Störungsmeldungen könnte ein Team beispielsweise Fragen zur Lesbarkeit der Beschriftung auf einem Foto, zu Geräuschen in einer Aufnahme und zum Blinken einer Anzeige in einem Video festlegen. Eine einzige Anfrage führt so multimodale Hinweise zu einer strukturierten Antwort für die anschließende Weiterleitung zusammen.
Cloudflare nennt eine mediane Latenz von etwa 130 ms für Textentscheidungen und etwa 150 ms für Bilder. Für ein 21 Sekunden langes Video mit Ton gibt das Unternehmen rund 1,5 Sekunden an. Dabei handelt es sich um Ergebnisse der von Cloudflare beschriebenen Tests; für die Bewertung des eigenen Systems sind auch die eigenen Dateien, das Fragenschema und die Bereitstellungsmethode relevant.
Offene Gewichte und Cloud-Ausführung
Cloudflare hat die Clef-omni-Gewichte auf Hugging Face unter der Apache-2.0-Lizenz veröffentlicht. Die Modellkarte beschreibt die lokale Ausführung und Tests auf einem H200-Beschleuniger; für die bfloat16-Konfiguration werden rund 64 GB Videospeicher angegeben. So können Teams eine selbst gehostete Bereitstellung unter Berücksichtigung der Hardware- und Konfigurationsanforderungen prüfen.
Für die Cloud-Version von Clef-omni kündigte Cloudflare einen Preis von 0,15 US-Dollar pro Million Eingabetoken an. Die Berechnung hängt von der Zusammensetzung der Eingabe ab: Cloudflare erläutert gesondert, wie Bilder und Audio in abrechenbare Token umgewandelt werden; auch Video beeinflusst das Eingabevolumen. Vor der Budgetplanung sollten die aktuellen Bedingungen in der Workers-AI-Dokumentation geprüft werden.
Clef-flash wird günstiger, das Cloud-Kontextfenster kleiner
Im selben Update senkte Cloudflare den Preis der gehosteten Clef-flash von 0,09 auf 0,038 US-Dollar pro Million Eingabetoken. Gleichzeitig wurde das Kontextfenster der gehosteten Version von 64.000 auf 24.000 Token verkleinert. Nach Angaben des Unternehmens überschritten nur 0,24 % der Anfragen den neuen Grenzwert.
Vor einem Wechsel zum niedrigeren Preis sollten Teams die Länge ihrer tatsächlichen Anfragen und Dokumente prüfen. Die veröffentlichten Clef-flash-Gewichte blieben unverändert: Cloudflare zufolge ist das Modell bei selbst gehosteter Bereitstellung auf ein Kontextfenster von bis zu 256.000 Token ausgelegt. Dieser Grenzwert gilt für die offene Variante, nicht für die Cloud-Version mit einem Fenster von 24.000 Token.
Die praktische Idee hinter Clef-omni besteht darin, multimodale Eingaben und die Auswahl aus vorgegebenen Optionen in einer Anfrage zu verbinden. Produkte, die Inhalte klassifizieren, Ton mit Bildern abgleichen oder festgelegte Felder ausfüllen, können das Modell anhand eigener Beispiele bewerten. Bei der Wahl zwischen Cloud- und Selbsthosting sollten Tarif, Hardwareanforderungen und benötigte Kontextlänge getrennt berücksichtigt werden.