class=”ArticleImagestyles__ImageWrapper-sc-lvd8v9-0 cWMVnY”>

OpenAI та Alibaba представили нові AI-моделі для розпізнавання мовленняOpenAI представила дві нові моделі для перетворення мови на текст — GPT-Live-Transcribe та GPT-Transcribe. Перша призначена для роботи в режимі реального часу з мінімальною затримкою, тоді як друга оптимізована для обробки наявних аудіофайлів і пакетної транскрипції. Обидві моделі отримали покращене розуміння контексту, що дозволяє точніше розпізнавати терміни, власні назви та різні мови.Про це інформує neowin.net.
OpenAI оновила моделі для транскрипції
За даними OpenAI, використання контексту значно покращує якість транскрипції. Компанія також заявляє про зменшення кількості помилок порівняно з попередніми моделями Whisper. Незалежне тестування від Artificial Analysis підтвердило високу точність GPT-Transcribe, а вартість використання моделі становить 4,5 долара за 1000 хвилин аудіо.
Alibaba представила нові голосові моделі
Водночас Alibaba представила нові моделі Qwen-Audio-3.0-Realtime Plus і Flash, які працюють у форматі «мова — мова». Вони підтримують природний діалог у режимі реального часу, дозволяють користувачеві переривати штучний інтелект під час відповіді, а також підтримують виклик функцій і створення персоналізованих копій голосу.Згідно з рейтингом Artificial Analysis, модель Qwen-Audio-3.0-Realtime Plus наразі перевершує рішення OpenAI за якістю взаємодії «мова — мова», здобувши 84,1% проти 79,1% у GPT-Realtime-2.1 High. Однак модель Alibaba поступається за швидкістю: її відповідь розпочинається приблизно через чотири секунди, тоді як рішення OpenAI реагує трохи більше ніж за одну секунду.За матеріалами: iTechua# Чат бот# OpenAI# ChatGPTМісце для вашої реклами
