jsonscraper

Cloudflare vydala Clef-omni pro strukturovanou analýzu audia a videa

Model zpracovává text, obrázky, audio a video a následně hodnotí odpovědi podle zadaného schématu. Ve stejné aktualizaci Cloudflare snížila cenu hostované Clef-flash a zkrátila kontext její hostované verze.

Redakční zásady Nahlásit chybu

Ověřit v rámci jednoho požadavku, zda je na fotografii čitelný štítek, zda na videu funguje ventilátor a zda je v audiozáznamu slyšet neobvyklý hluk — takový příklad Cloudflare uvádí u nového modelu Clef-omni. Společnost 9. října 2026 oznámila jeho vydání: model přijímá text, obrázky, audio a video a hodnotí možnosti odpovědí na zadané otázky.

Článek: Cloudflare vydala Clef-omni pro strukturovanou analýzu audia a videa
Shrnutí: Cloudflare 9. října oznámila vydání Clef-omni, modelu s otevřenými vahami pro strukturované rozhodování nad textem, obrázky, audiem a videem. Zároveň snížila cenu hostované Clef-flash z 0,09 na 0,038 USD za milion vstupních tokenů a zmenšila její kontextové okno ze 64 tisíc na 24 tisíc tokenů.
Role obrázku: úvodní obrázek — ústřední myšlenka
Sekce: 
Vizuální námět: kontrola průmyslového zařízení
© jsonscraper · ilustrace vytvořená pomocí AI

Clef-omni navazuje na rodinu rozhodovacích modelů Clef, kterou Cloudflare představila před týdnem. Vývojář určí schéma otázek a povolených odpovědí; model vrátí hodnocení jednotlivých možností, které lze zpracovat strukturovaným způsobem. To se hodí pro klasifikaci požadavků a multimediálních materiálů, u nichž je třeba výsledek předat aplikaci nebo pracovnímu postupu.

Jedno schéma pro různé typy vstupů

V oznámení Cloudflare o Clef-omni je model popsán jako řešení založené na Qwen3-Omni-30B-A3B-Instruct s architekturou mixture-of-experts. Podporuje text a JSON, obrázky, formáty WAV a MP3 pro audio a MP4 a WebM pro video. U každé otázky s možnostmi odpovědi model vrací jejich hodnocení; aplikace tak může výsledek zpracovat v předem stanoveném formátu.

Například při třídění hlášení o závadách může tým položit otázky, zda je na fotografii čitelný štítek, zda je v nahrávce slyšet hluk a zda na videu bliká kontrolka. Jeden společný požadavek tak spojí multimodální podklady do strukturované odpovědi pro další směrování.

Cloudflare uvádí medián latence přibližně 130 ms u textových rozhodnutí a asi 150 ms u obrázků. U 21sekundového videa se zvukem společnost uvádí přibližně 1,5 sekundy. Jde o výsledky testů deklarovaných společností; při vyhodnocování vlastního systému záleží také na souborech, schématu otázek a způsobu nasazení.

Otevřené váhy a cloudové nasazení

Cloudflare zveřejnila váhy Clef-omni na Hugging Face pod licencí Apache-2.0. Karta modelu popisuje lokální spuštění a testování na jednom akcelerátoru H200; pro konfiguraci bfloat16 uvádí přibližně 64 GB videopaměti. Týmy tak mohou posoudit vlastní nasazení s ohledem na požadavky na hardware a konfiguraci.

Uvnitř chytré brány LoRa Nebra
Pi Supply · licence Unsplash

Za cloudovou Clef-omni Cloudflare oznámila cenu 0,15 USD za milion vstupních tokenů. Výpočet závisí na složení vstupu: Cloudflare samostatně popisuje, jak se obrázky a audio převádějí na účtované tokeny, přičemž video rovněž ovlivňuje objem vstupních dat. Před sestavením rozpočtu je třeba ověřit aktuální podmínky v dokumentaci Workers AI.

Clef-flash zlevnila, ale kontextové okno cloudové verze se zmenšilo

Ve stejné aktualizaci Cloudflare snížila cenu hostované Clef-flash z 0,09 na 0,038 USD za milion vstupních tokenů. Kontextové okno hostované verze se zároveň zmenšilo ze 64 tisíc na 24 tisíc tokenů. Podle společnosti překračovalo nově stanovený limit pouze 0,24 % požadavků.

Před přechodem na nižší cenu by týmy měly ověřit skutečnou délku požadavků a dokumentů. Zveřejněné váhy Clef-flash se nezměnily: Cloudflare uvádí, že při vlastním nasazení model podporuje kontext až 256 tisíc tokenů. Tento limit platí pro otevřenou verzi, nikoli pro cloudovou verzi s oknem 24 tisíc tokenů.

Praktickým přínosem Clef-omni je spojení multimodálního vstupu s výběrem z předem stanovených možností v rámci jednoho požadavku. Produkty, které třídí materiály, porovnávají zvuk s obrazem nebo vyplňují pevně daná pole, mohou model otestovat na vlastních příkladech. Při výběru mezi cloudovým a vlastním nasazením je třeba samostatně zvážit cenu, hardwarové požadavky a požadovanou délku kontextu.

People

No people listed for this article yet.

Keep readingGoogle zpřístupnil SynthID Detector pro kontrolu obrázků, videí a audia
Read the next article

Proměňte přečtené ve funkční integraci

Prozkoumejte API sociálních dat jsonscraper, testujte požadavky a sestavte další workflow.

Prozkoumat API