10월 6일 Mistral은 Mistral Large 4의 공개 API 프리뷰를 시작했다. 개발자는 Mistral Studio에서 모델을 테스트할 수 있으며, 회사는 웨이트를 10월 말 출시할 계획이다. 10월 7일 기준으로 API를 통해 모델을 평가할 수 있지만, 웨이트를 다운로드할 수는 없다. 서비스에서 빠르게 테스트할지, 자체 환경에 배포할지 결정할 때 이 차이를 고려해야 한다.
현재 개발자가 이용할 수 있는 기능
Mistral 변경 기록에는 공개 프리뷰와 출시 후 2주간 제공되는 50% 한시 할인 내용이 나와 있다. 모델 페이지에는 멀티모달 입력, 함수 호출, 구조화된 출력, 배치 처리 및 에이전트 도구 지원이 명시돼 있다. 개발자는 이를 활용해 배포 여부를 결정하기 전에 API에서 자체 작업에 모델을 적용해 볼 수 있다.
확인 당시 모델 페이지에 표시된 가격은 입력 토큰 100만 개당 0.68달러, 캐시된 입력 토큰 100만 개당 0.07달러, 출력 토큰 100만 개당 2.09달러다. 일반 요금은 이보다 두 배 높게 표시돼 있으며, 할인은 출시 프로모션으로 기간이 한정돼 있다. 예산을 산정하기 전에 Mistral 문서에서 요금을 직접 확인하는 편이 좋다.
사양에 차이가 있다
Mistral은 Large 4를 멀티모달 Mixture of Experts 아키텍처로 설명한다. 문서에는 전체 파라미터 1조 500억 개, 활성 파라미터 520억 개로 나와 있지만, 회사 발표 자료에는 각각 1조 개와 490억 개로 기재돼 있다. 두 출처는 수치가 다른 이유를 설명하지 않는다. 따라서 하나의 숫자로 합치기보다 출처를 명시해 두 버전을 모두 전달하는 것이 정확하다.
문서에는 컨텍스트 윈도 크기가 100만 토큰으로 표시돼 있다. 긴 요청을 계획할 때는 실제로 사용하는 API 버전에서 이 사양을 확인하는 것이 유용하다. 프리뷰 사양은 문서가 업데이트되면서 조정될 수 있다.
벤치마크는 특정 작업만 보여준다
Mistral은 DeepSWE v1.1에서 61.7%, Terminal-Bench 4에서 28.3%, AutomationBench에서 59.9%의 결과를 보고했다. 이는 에이전트 방식의 소프트웨어 개발 작업, 터미널 워크플로, 비즈니스 프로세스 자동화라는 각 테스트에서 회사가 공개한 결과다. 이 수치들은 모델 품질을 하나의 기준으로 평가하기보다 어떤 검증을 할지 선택하는 참고 자료로 보는 것이 유용하다.
실제 적용을 결정하려면 개발자는 프로젝트를 대표하는 몇 가지 작업을 반복 실행하고, 모델 버전·프롬프트·설정을 기록하며, 테스트로 결과를 검증하고 재시도 비용도 고려해야 한다. 이런 테스트를 통해 공개된 결과가 특정 코드, 문서 또는 에이전트 워크플로에도 적용되는지 확인할 수 있다.
오픈 웨이트 출시는 다음 단계
Mistral은 추가 레드팀 테스트를 거친 뒤 10월 말까지 웨이트를 출시할 계획이라고 밝혔다. 이는 회사가 제시한 향후 계획이며, 게시일 기준 확인된 Large 4 사용 방법은 공개 API 프리뷰다. 자체 인프라에서 모델을 운영하고 직접 제어해야 하는 팀이라면, 실제 웨이트 공개와 함께 사용 조건이 발표되는 시점이 중요하다.
현재 개발자는 API에서 이용 가능 여부, 기능, 품질을 확인하고, 모델을 자체 환경으로 이전할지는 웨이트 출시 후 결정할 수 있다. 출시 초기에는 비교를 내세운 주장보다 실제 작업에서 재현 가능한 테스트 결과와 최신 요금 조건이 더 유용하다.