Головні звуки українського ІТ. Вгадаєш всі? 👉

OpenAI та Alibaba випустили нові голосові ШІ-моделі для розробників

Американська OpenAI та китайська Alibaba синхронно оголосили про реліз нових моделей штучного інтелекту, призначених для обробки та генерації голосу. Оновлення охоплюють як рішення для миттєвого перетворення мовлення на текст під час живих розмов, так і повноцінні моделі для прямих діалогів між користувачем і ШІ.

Залишити коментар
OpenAI та Alibaba випустили нові голосові ШІ-моделі для розробників

Американська OpenAI та китайська Alibaba синхронно оголосили про реліз нових моделей штучного інтелекту, призначених для обробки та генерації голосу. Оновлення охоплюють як рішення для миттєвого перетворення мовлення на текст під час живих розмов, так і повноцінні моделі для прямих діалогів між користувачем і ШІ.

Про це повідомляє видання Neowin.

Компанія OpenAI розширила свій API двома новими інструментами транскрипції — GPT-Live-Transcribe та GPT-Transcribe. Перша розроблена для завдань у режимі реального часу з мінімальною затримкою, тоді як друга орієнтована на обробку готових аудіофайлів у пакетному режимі. Головне нововведення обох моделей — здатність враховувати довільний контекст запису (галузеву термінологію, спеціальні ключові слова, очікувані мови та попередньо транскрибовані репліки).

За даними OpenAI, підтримка контексту дозволила підвищити семантичну точність із 38,5% до 44,6% для GPT-Live-Transcribe та з 41,6% до 45,2% для GPT-Transcribe. У тестах на реальних аудіозаписах рівень помилок GPT-Live-Transcribe знизився до 9,60% (проти 11,65% у GPT-Realtime-Whisper), а GPT-Transcribe показала рівень помилок 8,98% порівняно з 15,21% у Whisper-1. Згідно з оцінкою Artificial Analysis, рівень помилок GPT-Transcribe виявився ще нижчим і склав 3,31%, а вартість використання становить $4,50 за 1 000 хвилин.

У той самий час Alibaba презентувала моделі Qwen-Audio-3.0-Realtime Plus та Flash, орієнтовані на прямий формат взаємодії «мова-мова». Вони підтримують повнодуплексний режим, що дозволяє користувачеві перебивати співрозмовника-ШІ прямо під час виступу, а також дають змогу викликати зовнішні функції й використовувати власні клоновані голоси.

За даними індексу Speech-to-Speech від Artificial Analysis, модель Qwen-Audio-3.0-Realtime Plus посіла перше місце з результатом 84,1%, випередивши модель GPT-Realtime-2.1 High від OpenAI, яка набрала 79,1%. Китайська модель обійшла конкурента в тестах на логічне мислення та динаміку розмови. Втім, слабким місцем розробки Alibaba залишається затримка: час до першого аудіосигналу становить близько 4 секунд проти 1,14 секунди в аналозі від OpenAI.

Раніше науковий керівник компанії DeepL Штефан Мескен розповів, що штучний інтелект у голосовому перекладі долає етап «моторошної долини» та досягає рівня природного спілкування зі збереженням емоцій та інтонацій. Завдяки новим технологіям люди зможуть вільно розмовляти рідною мовою без бар'єрів за допомогою смарт-окулярів чи телефонів.

Читайте головні IT-новини країни в нашому Telegram
Читайте головні IT-новини країни в нашому Telegram
По темi
Читайте головні IT-новини країни в нашому Telegram
«Вивчення шести мов — марна трата часу». У DeepL розповіли як ШІ для перекладу голосу залишає синхроністів без роботи
«Вивчення шести мов — марна трата часу». У DeepL розповіли, як ШІ для перекладу голосу залишає синхроністів без роботи
По темi
«Вивчення шести мов — марна трата часу». У DeepL розповіли, як ШІ для перекладу голосу залишає синхроністів без роботи
Український розробник представив масштабне оновлення сервісу «Вільний Відеоперекладач» із багатоголосим дубляжем
Український розробник представив масштабне оновлення сервісу «Вільний Відеоперекладач» із багатоголосим дубляжем
По темi
Український розробник представив масштабне оновлення сервісу «Вільний Відеоперекладач» із багатоголосим дубляжем
«Google Перекладач» отримав тренування вимови та інтеграцію Gemini до свого 20-річчя
«Google Перекладач» отримав тренування вимови та інтеграцію Gemini до свого 20-річчя
По темi
«Google Перекладач» отримав тренування вимови та інтеграцію Gemini до свого 20-річчя
Читайте також
Штучний інтелект DALL-E навчився домальовувати картини. Як це виглядає
Штучний інтелект DALL-E навчився домальовувати картини. Як це виглядає
Штучний інтелект DALL-E навчився домальовувати картини. Як це виглядає
1 коментар
Штучний інтелект почав озвучувати фільми на MEGOGO
Штучний інтелект почав озвучувати фільми на MEGOGO
Штучний інтелект почав озвучувати фільми на MEGOGO
6 коментарів
Штучний інтелект навчився реставрувати старі фотографії, перетворюючи їх на якісні зображення: відео
Штучний інтелект навчився реставрувати старі фотографії, перетворюючи їх на якісні зображення: відео
Штучний інтелект навчився реставрувати старі фотографії, перетворюючи їх на якісні зображення: відео
2 коментарі
«Чи є у мене талант, якщо комп’ютер може імітувати мене?». Штучний інтелект пише книги авторам Amazon Kindle. The Verge поспілкувався з авторами та виявив багато цікавого
«Чи є у мене талант, якщо комп’ютер може імітувати мене?». Штучний інтелект пише книги авторам Amazon Kindle. The Verge поспілкувався з авторами та виявив багато цікавого
«Чи є у мене талант, якщо комп’ютер може імітувати мене?». Штучний інтелект пише книги авторам Amazon Kindle. The Verge поспілкувався з авторами та виявив багато цікавого
Письменники-романісти використовують штучний інтелект для створення своїх творів. Видання про технології The Verge поспілкувалося з письменницею Дженніфер Лепп, яка випускає нову книгу кожні дев’ять тижнів, й дізналося про те, як працює штучний інтелект для написання романів. Наводимо адаптований переклад статті. 

Хочете повідомити важливу новину? Пишіть у Telegram-бот

Головні події та корисні посилання в нашому Telegram-каналі

Обговорення
Коментарів поки немає.