Microsoft представила потокову транскрипцію MAI та нові голосові моделі

MAI-Transcribe-2-Streaming розпізнає живе мовлення, а MAI-Voice-2.1 і Flash озвучують текст. Пояснюємо тарифи, мови та обмеження preview.

Мікрофон, прозорі картки й динамік зі звуковими хвилями

1 жовтня Microsoft представила три аудіомоделі: MAI-Transcribe-2-Streaming, MAI-Voice-2.1 і MAI-Voice-2.1-Flash. Вони розраховані на розробників голосових сервісів. Назви схожі, але завдання різні: розпізнати сказане й озвучити відповідь — два окремі етапи.

Текст з’являється ще під час мовлення

Для MAI-Transcribe-2-Streaming заявлено 60 мов з автоматичним визначенням мови та вступну ціну $0,54 за годину аудіо до кінця 2026 року.

Документація потокової транскрипції пояснює, що застосунок отримує проміжні й остаточні результати. Перші можуть змінюватися з надходженням нових слів. Доступні інтеграції через Realtime API або Azure Speech SDK. У Azure це public preview без SLA, який Microsoft не рекомендує для виробничих навантажень.

Практичний наслідок: текст, що вже з’явився на екрані, не завжди є остаточним. Наприклад, у формі замовлення варто відрізняти попередньо розпізнану адресу від підтвердженого фрагмента. Це наша порада щодо інтерфейсу, а не результат власного тесту точності моделі.

Озвучення: дві версії й окремий список мов

За сторінкою MAI-Voice-2.1, стандартна версія коштує $22 за мільйон символів, Flash — $15. Обидві підтримують 23 мови. Flash орієнтована на швидку голосову взаємодію, стандартна — на якість і довше озвучення. Це оплата за символи, а не за годину аудіо, як у транскрипції.

Перелік підтримуваних мов і голосів потрібно звіряти в документації озвучення: 60 мов на вході не означають 60 мов на виході. Для використання власного зразка голосу потрібна згода; функція має обмежений доступ. Моделі озвучення в Azure також позначені як public preview без SLA.

Де спробувати й що врахувати

Microsoft вказує Microsoft Foundry і MAI Playground як точки доступу до трьох моделей; голосові версії також доступні через OpenRouter. Сам анонс API не означає, що ці можливості вже з’явилися в кожному диктофоні чи застосунку Windows.

Для людини, якій потрібен готовий текст інтерв’ю або зустрічі, важливий увесь сервіс: зручність завантаження, редагування, експорт і виправлення помилок. Перед вибором можна скористатися нашим гайдом з вибору AI-транскриптора. Нові моделі додають можливості розробникам, але не замінюють ці критерії готового продукту.

Обговорення

Долучайтеся до розмови

Пишіть по суті й поважайте інших читачів. Перший коментар може з’явитися після перевірки редакцією.

Залишити коментар

Ваш email не публікується. Поля зі зірочкою обов’язкові.

Надсилаючи коментар, ви погоджуєтеся на його перевірку та зберігання введених даних відповідно до політики конфіденційності.