1 жовтня Microsoft представила три аудіомоделі: MAI-Transcribe-2-Streaming, MAI-Voice-2.1 і MAI-Voice-2.1-Flash. Вони розраховані на розробників голосових сервісів. Назви схожі, але завдання різні: розпізнати сказане й озвучити відповідь — два окремі етапи.
Текст з’являється ще під час мовлення
Для MAI-Transcribe-2-Streaming заявлено 60 мов з автоматичним визначенням мови та вступну ціну $0,54 за годину аудіо до кінця 2026 року.
Документація потокової транскрипції пояснює, що застосунок отримує проміжні й остаточні результати. Перші можуть змінюватися з надходженням нових слів. Доступні інтеграції через Realtime API або Azure Speech SDK. У Azure це public preview без SLA, який Microsoft не рекомендує для виробничих навантажень.
Практичний наслідок: текст, що вже з’явився на екрані, не завжди є остаточним. Наприклад, у формі замовлення варто відрізняти попередньо розпізнану адресу від підтвердженого фрагмента. Це наша порада щодо інтерфейсу, а не результат власного тесту точності моделі.
Озвучення: дві версії й окремий список мов
За сторінкою MAI-Voice-2.1, стандартна версія коштує $22 за мільйон символів, Flash — $15. Обидві підтримують 23 мови. Flash орієнтована на швидку голосову взаємодію, стандартна — на якість і довше озвучення. Це оплата за символи, а не за годину аудіо, як у транскрипції.
Перелік підтримуваних мов і голосів потрібно звіряти в документації озвучення: 60 мов на вході не означають 60 мов на виході. Для використання власного зразка голосу потрібна згода; функція має обмежений доступ. Моделі озвучення в Azure також позначені як public preview без SLA.
Де спробувати й що врахувати
Microsoft вказує Microsoft Foundry і MAI Playground як точки доступу до трьох моделей; голосові версії також доступні через OpenRouter. Сам анонс API не означає, що ці можливості вже з’явилися в кожному диктофоні чи застосунку Windows.
Для людини, якій потрібен готовий текст інтерв’ю або зустрічі, важливий увесь сервіс: зручність завантаження, редагування, експорт і виправлення помилок. Перед вибором можна скористатися нашим гайдом з вибору AI-транскриптора. Нові моделі додають можливості розробникам, але не замінюють ці критерії готового продукту.

Долучайтеся до розмови
Пишіть по суті й поважайте інших читачів. Перший коментар може з’явитися після перевірки редакцією.