trendoscope | Unsorted

Telegram-канал trendoscope - Трендоскоп

4991

Обзор стартап-возможностей. @vladimir_zakoulov - здесь разбор полётов.

Subscribe to a channel

Трендоскоп

Момент для Generative Audio

Сейчас в GenML доминируют картинки и LLM. Но другие домены также развиваются, хоть и не так быстро — аудио, видео, 3D. На прошлой неделе проекты в области Generative Audio/Speech захватили новости:

- Meta AI представили text-to-speech модель Voicebox. Она может синтезировать речь на шести языках, а также редактировать записи, удалять шум, менять стиль речи. Качество синтеза превышает текущие SOTA-модели, при этом скорость работы Voicebox выше в 20 раз. Есть демка, но в открытый доступ выкладывать пока боятся.

- Google ответили своей моделью под названием AudioPaLM. Они объединили в одну архитектуру их языковую модель PaLM и звуковую AudioLM. В результате получилась модель, которая умеет «слушать и говорить», а также переводить речь со многих языков.

- Стартапы не отстают от корпораций. Создатели GenAudio платформы ElevenLabs объявили о раунде инвестиций в размере $19М. Лидировал сделку именитый фонд a16z — а это значительно бустит профиль стартапов в этом направлении.

Читать полностью…
Subscribe to a channel