Microsoft выпустила две ИИ-модели. Говорит, они заметно дешевле решений OpenAI
Компания представила две собственные ИИ-модели: MAI–Image-2.5-Pro для генерации и редактирования изображений и MAI–Voice-2-Flash для синтеза речи.
Компания представила две собственные ИИ-модели: MAI–Image-2.5-Pro для генерации и редактирования изображений и MAI–Voice-2-Flash для синтеза речи.
Компания представила две собственные ИИ-модели: MAI–Image-2.5-Pro для генерации и редактирования изображений и MAI–Voice-2-Flash для синтеза речи.
Microsoft позиционирует новинки как часть стратегии по снижению зависимости от сторонних разработчиков, включая OpenAI. Собственные модели уже используются в Bing, PowerPoint, OneDrive, Dynamics 365, Excel, GitHub Copilot и Azure. «Каждое из этих улучшений приближает нас к одной цели: продукты Microsoft должны работать на моделях Microsoft», — заявила компания.
MAI–Image-2.5-Pro ориентирована на задачи, где требуется высокое качество: создание рекламных изображений, точное редактирование и генерация текста внутри картинки. Стоимость использования модели составляет $5 за миллион входных текстовых токенов, $8 за миллион входных токенов изображений и $106 за миллион выходных токенов изображений.
Более легкая MAI–Image-2.5 уже полностью обслуживает Bing Image Creator. В PowerPoint ее использование, по данным Microsoft, позволяет сократить расходы на графические процессоры до 84% по сравнению с GPT-Image-2 от OpenAI.
В OneDrive модель стала основной для ряда инструментов редактирования изображений. Компания сообщает о росте доли сохранённых результатов на 26%, снижении задержки примерно на четверть и увеличении эффективности в 2,5 раза при средней нагрузке.
MAI–Voice-2-Flash предназначена для массовых голосовых сценариев: кол-центров, голосовых агентов и приложений, работающих в реальном времени. Она работает вдвое быстрее предыдущей версии MAI–Voice-2 и стоит на 32% дешевле — $15 за миллион символов.

Модель уже используется в Dynamics 365 Contact Center, которым пользуются, в частности, T-Mobile и EasyJet. Microsoft утверждает, что переход на MAI–Voice-2-Flash сократил затраты на GPU до 89%. Она также подключена к Azure Voice Live для разработчиков голосовых агентов.
Компания привела данные и о других собственных моделях. Медицинский сервис Dragon Copilot, которым пользуются 170 тысяч специалистов, работает на MAI-Transcribe-1.5. За последний квартал система обработала 28 миллионов приемов. По оценке Microsoft, модель снизила количество ошибок при распознавании речи и определении языка примерно на 50% для большинства из 58 поддерживаемых языков.
Отдельное направление — небольшие специализированные модели. MAI-Code-1-Flash, запущенная в GitHub Copilot, по внутренним данным Microsoft, показывает примерно на 10% более высокий показатель принятия сгенерированного кода, чем GPT-5.4 Mini и Claude Haiku 4.5, одновременно расходуя на 10% меньше токенов.
Затем Microsoft дополнительно обучила эту модель в среде Excel. В результате она, как утверждает компания, сравнялась с GPT-5.6 в наиболее распространенных задачах с электронными таблицами. При этом модель можно запускать на ускорителях Nvidia H100 и даже A100, не используя новейшее оборудование.
Microsoft уже перенаправляет часть запросов в своих продуктах на модели MAI, когда они не уступают решениям OpenAI и Anthropic. При этом компания не планирует полностью отказываться от партнерских моделей: они останутся частью общей системы маршрутизации.



Релоцировались? Теперь вы можете комментировать без верификации аккаунта.