4991
Обзор стартап-возможностей. @vladimir_zakoulov - здесь разбор полётов.
Момент для Generative Audio
Сейчас в GenML доминируют картинки и LLM. Но другие домены также развиваются, хоть и не так быстро — аудио, видео, 3D. На прошлой неделе проекты в области Generative Audio/Speech захватили новости:
- Meta AI представили text-to-speech модель Voicebox. Она может синтезировать речь на шести языках, а также редактировать записи, удалять шум, менять стиль речи. Качество синтеза превышает текущие SOTA-модели, при этом скорость работы Voicebox выше в 20 раз. Есть демка, но в открытый доступ выкладывать пока боятся.
- Google ответили своей моделью под названием AudioPaLM. Они объединили в одну архитектуру их языковую модель PaLM и звуковую AudioLM. В результате получилась модель, которая умеет «слушать и говорить», а также переводить речь со многих языков.
- Стартапы не отстают от корпораций. Создатели GenAudio платформы ElevenLabs объявили о раунде инвестиций в размере $19М. Лидировал сделку именитый фонд a16z — а это значительно бустит профиль стартапов в этом направлении.