Amazon создала крупнейшую на сегодняшний день ИИ-модель для преобразования текста в речь

  • 19.02.2024 23:58
  • 2.9k+

Американская технологическая компания Amazon анонсировала прорыв в области ИИ-технологий: BASE TTS (Big Adaptive Streamable TTS with Emergent options), нейросеть, способную преобразовывать текст в речь с беспрецедентной реалистичностью.

Создатели нейросети представили результаты своих наработок на портале научных публикаций arXiv.
Отмечается, что ИИ-модель имеет 980 млн параметров и обучена на 100 тыс. часов записей речи преимущественно на английском языке.
При этом разработчики BASE TTS не ограничились английским. Модель способна правильно произносить слова и фразы на других языках, включая известные выражения, такие как "adios, amigo".
BASE TTS уже прошла тестирование на небольших наборах данных. Результаты показали, что нейросеть способна использовать сложные существительные, выражать эмоции, применять пунктуацию и даже задавать вопросы с акцентом на нужных словах.
В Amazon видят большой потенциал BASE TTS в образовательной сфере. Модель может стать обучающим приложением, помогая людям с дислексией и другими трудностями чтения.


вчера 12:19
5k+

Ученые создают ИИ, который будет генерировать исторически достоверные изображения

Профессор древней истории Цюрихского университета Феликс К. Майер вместе с программистом Филиппом Штребелем разрабатывают генератор изображений на базе искусственного интеллекта, способный создавать максимально достоверные сцены из Древнего Рима и Древней Греции...

20.09.2025 06:52
859

OpenAI займется разработкой гуманоидных роботов и уже ищет специалистов

Компания OpenAI формирует новую команду по робототехнике, в том числе для работы над гуманоидными системами. Об этом сообщает Wired. По данным издания, компания активно привлекает специалистов в области управления роботами...

11.09.2025 00:17
2.1k+

Tencent выпустила ИИ-модель для создания 3D-миров из одного изображения

Китайская компания Tencent представила открытую ИИ-модель HunyuanWorld-Voyager, которая позволяет генерировать видеоряд с 3D-эффектом на основе одного исходного изображения. Алгоритм формирует до 49 кадров, что составляет около двух секунд видео, и объединяет их в последовательности длительностью несколько минут...

27.08.2025 15:44
5k+

Китай строит первый в мире подводный дата-центр для искусственного интеллекта

В Китае ведется строительство первого в мире подводного центра обработки данных для искусственного интеллекта. Объект находится в 10 км от побережья Шанхая, а его питание будет обеспечивать близлежащая морская ветроэлектростанция, передает Live Science...