jsonscraper

Cloudflare julkaisi Clef-omnin äänen ja videon rakenteiseen analyysiin

Malli käsittelee tekstiä, kuvia, ääntä ja videota sekä arvioi vastauksia ennalta määritellyn skeeman mukaisesti. Samassa päivityksessä Cloudflare laski Clef-flashin isännöidyn version hintaa ja lyhensi sen konteksti-ikkunaa.

Toimituksellinen linjaus Ilmoita virheestä

Yhdellä kyselyllä voi tarkistaa, erottuuko merkintä valokuvasta, käykö tuuletin videolla ja kuuluuko äänitteessä ylimääräistä melua — näin Cloudflare esittelee uuden Clef-omni-mallin käyttöä. Yhtiö ilmoitti mallin julkaisusta 9. lokakuuta 2026: malli ottaa vastaan tekstiä, kuvia, ääntä ja videota sekä arvioi vastausvaihtoehtoja ennalta määriteltyjen kysymysten perusteella.

Artikkeli: Cloudflare julkaisi Clef-omnin äänen ja videon rakenteiseen analyysiin
Yhteenveto: Cloudflare ilmoitti 9. lokakuuta julkaisevansa Clef-omnin, avointen painojen mallin, joka tuottaa rakenteisia päätöksiä tekstistä, kuvista, äänestä ja videosta. Yhtiö laski myös isännöidyn Clef-flashin hinnan 0,09 dollarista 0,038 dollariin miljoonaa syötetokenia kohti ja pienensi sen konteksti-ikkunan 64 000 tokenista 24 000 tokeniin.
Kuvan rooli: kansikuva — keskeinen ajatus
Osio: 
Visuaalinen aihe: Teollisuuslaitteiden tarkastus
© jsonscraper · tekoälyn luoma kuvitus

Clef-omni jatkaa Clef-päätösmallien perhettä, jonka Cloudflare esitteli viikkoa aiemmin. Kehittäjä määrittelee kysymysten ja sallittujen vastausten skeeman, ja malli palauttaa vastausvaihtoehtojen arviot rakenteista käsittelyä varten. Tämä soveltuu tukipyyntöjen ja multimodaalisten aineistojen luokitteluun, kun tulos on välitettävä sovellukselle tai työnkulkuun.

Yksi skeema erilaisille syötteille

Cloudflaren Clef-omni-julkaisun mukaan malli perustuu Qwen3-Omni-30B-A3B-Instruct-malliin, jossa käytetään mixture-of-experts-arkkitehtuuria. Se tukee tekstiä ja JSON-muotoa, kuvia, WAV- ja MP3-äänitiedostoja sekä MP4- ja WebM-videoita. Malli antaa arviot kunkin monivalintakysymyksen vaihtoehdoille, minkä ansiosta sovellus voi käsitellä tuloksen ennalta määritellyssä muodossa.

Esimerkiksi vikailmoituksia lajiteltaessa tiimi voi esittää kysymyksiä valokuvan merkinnän luettavuudesta, äänitteen melusta ja videolla vilkkuvasta merkkivalosta. Näin yksi kysely kokoaa eri mediamuotojen havainnot rakenteiseksi vastaukseksi, jonka perusteella ilmoitus voidaan reitittää eteenpäin.

Cloudflaren mukaan tekstipäätösten mediaaniviive on noin 130 ms ja kuvien noin 150 ms. Ääntä sisältävän 21 sekunnin videon käsittelyyn yhtiö ilmoittaa kuluvan noin 1,5 sekuntia. Nämä ovat yhtiön ilmoittamien testien tuloksia; oman järjestelmän arvioinnissa merkitystä on myös käytettävillä tiedostoilla, kysymysten skeemalla ja käyttöönottotavalla.

Avoimet painot ja pilvikäyttö

Cloudflare julkaisi Clef-omnin painot Hugging Facessa Apache-2.0-lisenssillä. Mallikortissa kuvataan paikallinen käyttö ja testaus yhdellä H200-kiihdyttimellä; bfloat16-muotoiselle kokoonpanolle ilmoitetaan noin 64 Gt videomuistia. Tiimit voivat arvioida omatoimista käyttöönottoa laitteisto- ja määritysvaatimukset huomioiden.

Nebra Smart LoRa -yhdyskäytävän sisällä
Pi Supply · Unsplash-lisenssi

Cloudflare ilmoitti Clef-omnin pilviversion hinnaksi 0,15 dollaria miljoonaa syötetokenia kohti. Laskutus riippuu syötteen koostumuksesta: Cloudflare kuvaa erikseen, miten kuvat ja ääni muunnetaan laskutettaviksi tokeneiksi, ja myös video kasvattaa syötetietojen määrää. Budjettia laskiessa kannattaa tarkistaa ajantasaiset ehdot Workers AI -dokumentaatiosta.

Clef-flashin hinta laski, mutta pilviversion konteksti lyheni

Samassa päivityksessä Cloudflare laski isännöidyn Clef-flashin hinnan 0,09 dollarista 0,038 dollariin miljoonaa syötetokenia kohti. Isännöidyn version konteksti-ikkuna pieneni samalla 64 000 tokenista 24 000 tokeniin. Yhtiön mukaan vain 0,24 prosenttia kyselyistä ylitti uuden rajan.

Ennen edullisempaan hintaan siirtymistä tiimien kannattaa tarkistaa todellisten kyselyjen ja asiakirjojen pituus. Clef-flashin julkaistut painot eivät muuttuneet: Cloudflaren mukaan itse ylläpidettävä versio tukee jopa 256 000 tokenin kontekstia. Tämä raja koskee avointa versiota, ei pilviversiota, jonka konteksti-ikkuna on 24 000 tokenia.

Clef-omnin käytännön ajatuksena on yhdistää multimodaalinen syöte ja valinta ennalta määritellyistä vaihtoehdoista samaan kyselyyn. Tuotteissa, jotka luokittelevat aineistoja, vertaavat ääntä kuvaan tai täyttävät kiinteitä kenttiä, mallia voi arvioida omilla esimerkeillä. Pilvipalvelun ja itse ylläpidettävän asennuksen välillä valittaessa kannattaa huomioida erikseen hinta, laitteistovaatimukset ja tarvittava kontekstin pituus.

People

No people listed for this article yet.

Keep readingGoogle avasi SynthID Detectorin kuvien, videoiden ja äänen tarkistamiseen
Read the next article

Muuta lukemasi toimivaksi integraatioksi

Tutustu jsonscraperin sosiaalisen datan rajapintoihin, testaa pyyntöjä ja rakenna seuraava työnkulkusi.

Tutki API:t