jsonscraper

Mistral Large 4 ya está disponible mediante API; los pesos abiertos llegarán más adelante

La vista previa pública comenzó el 6 de octubre. Analizamos qué se puede comprobar ahora y qué especificaciones aún presentan discrepancias.

El 6 de octubre, Mistral abrió la vista previa pública de la API de Mistral Large 4. Los desarrolladores ya pueden probar el modelo mediante Mistral Studio, mientras que la empresa prevé publicar los pesos a finales de octubre. A 7 de octubre, el modelo se puede evaluar mediante API; sus pesos aún no se pueden descargar. Este estado es importante a la hora de elegir entre hacer pruebas rápidas en el servicio o desplegarlo por cuenta propia.

Un edificio alto con muchas ventanas junto a una calle
Shabeeba Ameen · Licencia de Unsplash

Qué pueden hacer ahora los desarrolladores

La entrada del changelog de Mistral confirma la vista previa pública y un descuento temporal del 50 % en el lanzamiento, durante dos semanas. La ficha del modelo enumera la compatibilidad con entrada multimodal, llamadas a funciones, salida estructurada, procesamiento por lotes y herramientas para agentes. Esto permite a los desarrolladores probar el modelo con sus propias tareas mediante API antes de decidir si lo despliegan.

En el momento de la consulta, la ficha indica un precio de 0,68 $ por millón de tokens de entrada, 0,07 $ por millón de tokens de entrada en caché y 2,09 $ por millón de tokens de salida. También muestra tarifas habituales que duplican esas cantidades: el descuento es promocional y tiene una duración limitada. Antes de calcular el presupuesto, conviene verificar las tarifas directamente en la documentación de Mistral.

Las especificaciones presentan discrepancias

Mistral describe Large 4 como una arquitectura multimodal Mixture of Experts. La documentación indica 1,05 billones de parámetros en total y 52.000 millones activos; en el anuncio de la empresa figuran 1 billón y 49.000 millones activos. Las fuentes no explican por qué difieren los valores. Por eso, es más preciso atribuir cada cifra a su fuente que reducirlas a una sola.

La documentación indica una ventana de contexto de un millón de tokens. Para planificar solicitudes largas, conviene confirmar esta especificación en la versión de API que se utilice: los parámetros de la vista previa podrían precisarse a medida que se actualice la documentación.

Cualquier obra arquitectónica que no exprese serenidad es un error
Ashish Mehta · Licencia de Unsplash

Los benchmarks evalúan tareas concretas

Mistral informa de resultados del 61,7 % en DeepSWE v1.1, el 28,3 % en Terminal-Bench 4 y el 59,9 % en AutomationBench. Son resultados publicados por la propia empresa para pruebas específicas: respectivamente, tareas de desarrollo con comportamiento de agente, flujos de trabajo en terminal y automatización de procesos empresariales. Conviene tomarlos como referencias para elegir qué evaluar, no como una medida única de la calidad del modelo.

Para tomar una decisión práctica, los desarrolladores deberían repetir varias tareas representativas de su proyecto: fijar la versión del modelo, los prompts y la configuración, comprobar los resultados con pruebas y tener en cuenta el coste de los intentos repetidos. Esta prueba permitirá evaluar hasta qué punto los resultados publicados se trasladan a su código, sus documentos o sus procesos con agentes.

Los pesos abiertos siguen siendo el siguiente paso

Mistral declaró que prevé publicar los pesos a finales de octubre, tras realizar pruebas adicionales de red team. Se trata de un plan futuro de la empresa; en la fecha de publicación, la forma confirmada de usar Large 4 es mediante la vista previa pública de la API. Para los equipos que necesitan su propia infraestructura y gestionar el modelo por cuenta propia, el hito clave será la publicación efectiva de los pesos y de las condiciones de uso correspondientes.

Por ahora, los desarrolladores pueden comprobar la disponibilidad, las funciones y la calidad mediante API, y aplazar la decisión de trasladar el modelo a su propio entorno hasta que se publiquen los pesos. En esta fase inicial, lo más útil no son las afirmaciones comparativas, sino los resultados de pruebas reproducibles con tareas de trabajo y las condiciones tarifarias vigentes.

Keep readingGitHub presenta ReviewBench: los revisores de IA se compararán por los defectos que detecten
Read the next article

Artículos relacionados

Breaking News · Noticias

GitHub presenta ReviewBench: los revisores de IA se compararán por los defectos que detecten

El 5 de octubre, GitHub presentó ReviewBench, una versión preliminar de investigación de un benchmark para agentes que revisan código. Sus métricas distinguen entre problemas detectados, omisiones y ruido innecesario, mientras que los resultados de la prueba A/B interna de la empresa describen un experimento concreto, no una clasificación general de modelos.

Convierte lo que lees en una integración funcional

Explora las API de datos sociales de jsonscraper, prueba solicitudes y crea tu próximo flujo de trabajo.

Explorar APIs