jsonscraper

Cloudflare выпустила Clef-omni для структурированного анализа аудио и видео

Модель обрабатывает текст, изображения, аудио и видео, а затем оценивает ответы по заданной схеме. В том же обновлении Cloudflare снизила цену размещённой Clef-flash и сократила её контекстное окно.

编辑政策 报告错误

Проверить по одному обращению, читается ли маркировка на фото, работает ли вентилятор на видео и слышен ли посторонний шум в аудиозаписи, — такой пример Cloudflare приводит для новой модели Clef-omni. 9 октября 2026 года компания объявила о её выпуске: модель принимает текст, изображения, аудио и видео и оценивает варианты ответа на заданные вопросы.

Статья: Cloudflare выпустила Clef-omni для структурированного анализа аудио и видео
Краткое содержание: 9 октября Cloudflare объявила о выпуске Clef-omni — модели с открытыми весами для структурированных решений на основе текста, изображений, аудио и видео. Компания также снизила цену размещённой Clef-flash с $0,09 до $0,038 за миллион входных токенов и уменьшила её контекстное окно с 64 тыс. до 24 тыс. токенов.
Роль изображения: обложка — центральная идея
Раздел: 
Визуальный сюжет: осмотр промышленного оборудования
© jsonscraper · иллюстрация, созданная ИИ

Clef-omni продолжает семейство моделей принятия решений Clef, которое Cloudflare представила неделей ранее. Разработчик задаёт схему вопросов и допустимых ответов; модель возвращает оценки вариантов, пригодные для структурированной обработки. Это подходит для классификации обращений и мультимедийных материалов, когда результат нужно передать приложению или включить в рабочий процесс.

Одна схема для разных типов входных данных

В анонсе Cloudflare о Clef-omni модель описана как решение на базе Qwen3-Omni-30B-A3B-Instruct с архитектурой смеси экспертов. Она поддерживает текст и JSON, изображения, аудиофайлы WAV и MP3, а также видео в форматах MP4 и WebM. Для каждого вопроса с вариантами ответа модель выдаёт оценки вариантов, позволяя приложению обрабатывать результат в заранее заданном формате.

Например, при сортировке заявок о неисправностях команда может задать вопросы о читаемости маркировки на фотографии, шуме в записи и мигании индикатора на видео. Один запрос объединяет мультимодальные свидетельства в структурированный ответ для дальнейшей маршрутизации.

Cloudflare сообщает о медианной задержке около 130 мс для текстовых решений и около 150 мс для изображений. Для 21-секундного видео со звуком компания указывает примерно 1,5 секунды. Это результаты испытаний, проведённых самой компанией; при оценке собственной системы важны также её файлы, схема вопросов и способ развёртывания.

Открытые веса и облачный запуск

Cloudflare опубликовала веса Clef-omni на Hugging Face под лицензией Apache-2.0. В карточке модели описан локальный запуск и тестирование на одном ускорителе H200; для конфигурации bfloat16 указано около 64 ГБ видеопамяти. Это позволяет командам оценить возможность самостоятельного размещения с учётом требований к оборудованию и настройке.

Внутри шлюза Nebra Smart LoRa
Pi Supply · лицензия Unsplash

Для облачной Clef-omni Cloudflare объявила цену $0,15 за миллион входных токенов. Расчёт зависит от состава входных данных: Cloudflare отдельно описывает, как изображения и аудио преобразуются в тарифицируемые токены; видео также влияет на объём входных данных. Перед составлением бюджета следует сверить актуальные условия в документации Workers AI.

Clef-flash подешевела, а контекст облачной версии сократился

В том же обновлении Cloudflare снизила цену размещённой Clef-flash с $0,09 до $0,038 за миллион входных токенов. Контекстное окно размещённой версии одновременно сократилось с 64 тыс. до 24 тыс. токенов. По данным компании, лишь 0,24% запросов превышали новый порог.

Перед переходом на более низкий тариф командам стоит проверить длину фактических запросов и документов. Опубликованные веса Clef-flash не менялись: Cloudflare указывает, что при самостоятельном размещении модель рассчитана на контекст до 256 тыс. токенов. Этот предел относится к открытому варианту, а не к облачной версии с окном в 24 тыс. токенов.

Практическая идея Clef-omni — объединить мультимодальный ввод и выбор из заранее заданных вариантов в одном запросе. Её можно оценить на собственных примерах в продуктах, которые классифицируют материалы, сопоставляют звук с изображением или заполняют фиксированные поля. При выборе между облачным и самостоятельным размещением следует отдельно учитывать тариф, требования к оборудованию и необходимую длину контекста.

People

No people listed for this article yet.

Keep reading谷歌开放 SynthID Detector,可检查图像、视频和音频
Read the next article

将阅读内容转化为可用的集成

探索 jsonscraper 社交数据 API、测试请求并构建下一个工作流。

查看 API