Live
AI models

MiMo-VL-7B-SFT

Training compute
1.2×10²⁴ FLOP
Parameters
7B
Published
Jun 4, 2025

MiMo-VL-7B-SFT is an AI model developed by Xiaomi Corp (China), first published in June 2025. It works in the vision, multimodal, language and video domain, on tasks such as character recognition (ocr), image captioning, language modeling/generation and 4 more.

Training it took an estimated 1.2×10²⁴ FLOP of compute (estimation method: operation counting). The model has 7,000,000,000 parameters. It was trained on roughly 2.4T datapoints.

Access: Open weights (unrestricted). Its weights are openly available. It is built on top of MiMo-7B-Base. Epoch AI rates the confidence of this record as confident.

Full record
Organization
Xiaomi Corp
Country of organization
China
Domain
Vision, Multimodal, Language, Video
Task
Character recognition (OCR), Image captioning, Language modeling/generation, Question answering, Visual question answering, Video, Video description
Training compute
1.2×10²⁴ FLOP
Compute estimation method
Operation counting
Parameters
7,000,000,000
Dataset size
2.4T
Model accessibility
Open weights (unrestricted)
Open weights
Yes
Base model
MiMo-7B-Base
Epoch confidence
Confident
More from Xiaomi Corp
SourceEpoch AI, 'AI Models'. Published online at epoch.ai. Retrieved 2026-07-29 from https://epoch.ai/data/ai-models. Licensed under CC BY 4.0.
← All ai models