jsonscraper

Cloudflare wydała Clef-omni do uporządkowanej analizy audio i wideo

Model przetwarza tekst, obrazy, dźwięk i wideo, a następnie ocenia odpowiedzi według określonego schematu. W tej samej aktualizacji Cloudflare obniżyła cenę hostowanego Clef-flash i skróciła kontekst jego hostowanej wersji.

Polityka redakcyjna Zgłoś błąd

Sprawdzenie w ramach jednego zgłoszenia, czy oznaczenie na zdjęciu jest czytelne, wentylator działa na nagraniu wideo, a na nagraniu audio słychać nietypowy hałas — taki przykład Cloudflare podaje dla nowego modelu Clef-omni. 9 października 2026 roku firma ogłosiła jego wydanie: model przyjmuje tekst, obrazy, dźwięk i wideo, a następnie ocenia możliwe odpowiedzi na zadane pytania.

Artykuł: Cloudflare wydała Clef-omni do uporządkowanej analizy audio i wideo
Podsumowanie: 9 października Cloudflare ogłosiła wydanie Clef-omni — modelu z otwartymi wagami do uporządkowanego podejmowania decyzji na podstawie tekstu, obrazów, dźwięku i wideo. Firma obniżyła również cenę hostowanego Clef-flash z 0,09 do 0,038 USD za milion tokenów wejściowych i zmniejszyła jego okno kontekstu z 64 tys. do 24 tys. tokenów.
Rola obrazu: okładka — główna idea
Sekcja: 
Temat wizualny: kontrola urządzeń przemysłowych z
© jsonscraper · ilustracja wygenerowana przez AI

Clef-omni rozwija rodzinę modeli decyzyjnych Clef, którą Cloudflare zaprezentowała tydzień wcześniej. Programista definiuje schemat pytań i dozwolonych odpowiedzi; model zwraca oceny tych odpowiedzi, które można przetwarzać w uporządkowany sposób. Nadaje się to do klasyfikowania zgłoszeń i materiałów multimedialnych, gdy wynik trzeba przekazać aplikacji lub przepływowi pracy.

Jeden schemat dla różnych rodzajów danych wejściowych

W ogłoszeniu Cloudflare o Clef-omni model opisano jako oparty na Qwen3-Omni-30B-A3B-Instruct i architekturze mixture-of-experts. Obsługuje tekst i JSON, obrazy, pliki WAV i MP3 z dźwiękiem oraz MP4 i WebM z wideo. Dla każdego pytania wielokrotnego wyboru model ocenia dostępne odpowiedzi, dzięki czemu aplikacja może przetworzyć wynik w z góry określonym formacie.

Na przykład podczas sortowania zgłoszeń o usterkach zespół może zadać pytania o czytelność oznaczenia na zdjęciu, hałas na nagraniu oraz migający wskaźnik na wideo. Takie pojedyncze zapytanie łączy dowody z różnych mediów w uporządkowaną odpowiedź, którą można wykorzystać w dalszym kierowaniu zgłoszenia.

Cloudflare podaje medianę opóźnienia około 130 ms dla decyzji opartych na tekście i około 150 ms dla obrazów. W przypadku 21-sekundowego wideo z dźwiękiem firma wskazuje około 1,5 sekundy. Są to wyniki testów deklarowanych przez firmę; przy ocenie własnego systemu znaczenie mają również jego pliki, schemat pytań i sposób wdrożenia.

Otwarte wagi i uruchamianie w chmurze

Cloudflare opublikowała wagi Clef-omni na Hugging Face na licencji Apache-2.0. Karta modelu opisuje uruchamianie lokalne i testowanie na pojedynczym akceleratorze H200; dla konfiguracji bfloat16 podano około 64 GB pamięci wideo. Dzięki temu zespoły mogą ocenić samodzielne hostowanie, uwzględniając wymagania sprzętowe i konfiguracyjne.

Wnętrze bramy LoRa Nebra Smart
Pi Supply · Licencja Unsplash

Za korzystanie z chmurowej wersji Clef-omni Cloudflare ogłosiła cenę 0,15 USD za milion tokenów wejściowych. Koszt zależy od rodzaju danych wejściowych: Cloudflare osobno opisuje, jak obrazy i dźwięk są przeliczane na tokeny podlegające rozliczeniu; na ich liczbę wpływa również wideo. Przed oszacowaniem budżetu warto sprawdzić aktualne warunki w dokumentacji Workers AI.

Clef-flash jest tańszy, ale kontekst wersji chmurowej został skrócony

W tej samej aktualizacji Cloudflare obniżyła cenę hostowanego Clef-flash z 0,09 do 0,038 USD za milion tokenów wejściowych. Jednocześnie okno kontekstu hostowanej wersji zmniejszyło się z 64 tys. do 24 tys. tokenów. Według firmy tylko 0,24% zapytań przekraczało nowy limit.

Przed przejściem na niższą cenę zespoły powinny sprawdzić długość rzeczywistych zapytań i dokumentów. Opublikowane wagi Clef-flash nie uległy zmianie: Cloudflare podaje, że model uruchamiany samodzielnie obsługuje kontekst do 256 tys. tokenów. Ten limit dotyczy otwartej wersji, a nie wersji chmurowej z oknem 24 tys. tokenów.

Praktyczna idea Clef-omni polega na połączeniu danych z wielu mediów z wyborem spośród z góry określonych odpowiedzi w jednym zapytaniu. Można ją oceniać na własnych przykładach w produktach, które klasyfikują materiały, zestawiają dźwięk z obrazem lub wypełniają ustalone pola. Wybierając między wersją chmurową a samodzielną instalacją, należy osobno uwzględnić cenę, wymagania sprzętowe i potrzebną długość kontekstu.

People

No people listed for this article yet.

Keep readingGoogle udostępniło SynthID Detector do sprawdzania obrazów, wideo i audio
Read the next article

Zmień lekturę w działającą integrację

Poznaj API danych społecznościowych jsonscraper, testuj zapytania i buduj kolejne procesy.

Poznaj API