ai_newz | Unsorted

Telegram-канал ai_newz - эйай ньюз

93643

Культурно освещаю самые и не самые важные новости из мира AI, и облагораживаю их своим авторитетным профессиональным мнением. В свободное время работаю как Staff Research Scientist в Meta Generative AI в Швейцарии. Aвтор: @asanakoy PR: @ssnowysnow

Subscribe to a channel

эйай ньюз

BFL выпустили FLUX 3 Action для управления роботами

BFL дообучили основу видеомодели FLUX 3 на записях работы роботов, где кадры с камер синхронизированы с положениями суставов и действиями. Модель на 7B учится совместно восстанавливать из шума будущие кадры и последовательность движений.

По текстовой задаче, текущим кадрам и состоянию робота она предсказывает движения суставов и захвата вместе с их визуальным результатом. Робот исполняет часть команд, получает новые кадры и пересчитывает следующие движения.

На симуляционном RoboLab-120 заняли первое место с 42.9% успешных попыток против 36.8% у Cosmos 3 Nano на 16B. Под нового робота нужно дообучение. Веса под FLUX Kommunity License, код под Apache 2.0.

Техрепорт
Веса
Код

@ai_newz

Читать полностью…

эйай ньюз

OpenAI готовит Pro Max подписку за $500 в месяц

Датамайнеры нашли упоминания нового тира подписки в фронтенде ChatGPT, из уникальных фич "более быстрый Codex и Work", скорее всего речь идёт о доступе к Cerebras в подписке. Насколько большие там лимиты непонятно, а представить её могут уже на DevDay в следующий вторник. Ну а тем временем оформить Pro подписку за $200 всё ещё нельзя.

@ai_newz

Читать полностью…

эйай ньюз

Яндекс открыл веса Alice AI Foundation LLM

Alice AI Foundation LLM представляет собой собственный MoE-претрейн Яндекса. Весь цикл обучения провели с нуля, без стартовых весов сторонних открытых моделей.

В модели 80B параметров, из которых на каждый токен активируются 3B. Это меньше, чем у большинства других открытых претрейнов, но по бенчам результаты в паритете, а иногда и лучше. При обучении отдельно оптимизировали обмен данными между видеокартами и отбор материалов, чтобы сократить вычисления при сохранении качества. В техрепорте есть комплиментарный замер с Nemotron и Qwen – с кодом и с математикой. Плюс к этому заявляют, что заложили базу для рассуждений ещё на претрейне.

Модель выпустили под Apache 2.0, её можно свободно использовать и дообучать. За пару дней у модели уже больше 2000 скачиваний на HF.

Техрепорт
Веса на HF

@ai_newz

Читать полностью…

эйай ньюз

Anthropic выпустили Opus 5.5

По бенчам лучше Fable 5.1, уже доступен в чате, клод коде и апи. Цену за токен снизили по сравнению с Opus 5 — теперь она $4/$20 за миллион токенов. Кроме этого повысили пятичасовые лимиты и дали banked ресет.

@ai_newz

Читать полностью…

эйай ньюз

Вас тоже напрягают записывальщики митингов, которых все сейчас таскают по созвонам? (меня да, как CEO часто с этим сталкиваюсь). А ведь еще часто записывают, ничего мне не говоря, через wispr или granola.

Как и следовало ожидать нашлись люди, которые придумали продукт для противостояния этому.

Локально крутится LLM, которая адверсариально натренирована против wispr и прочих voice2text моделей. Она в риалтайме добавляет adversarial noise к вашему аудиостриму, который ломает распознавалки речи на другой стороне.

Из минусов - это сейчас иногда превращает вашу речь в что-то, что трудно распарсить и человеку, кек))

Теперь voice2text модели придется регулярно перетренировывать, чтобы они были робастными к таким атакам!

Ну а вообще респект ребятам, довести до ума, убрать явный шум и будет полезный продукт, для поддержания privacy звонков.

Сам продукт

@ai_newz

Читать полностью…

эйай ньюз

Нейродайджест за неделю (#130)

LLM
- Astra в Blender — Два примера видосов, которые модель делает через Blender.
- GigaChat 3.5 Reasoning — Сбер открыли веса MoE 432B-A28B. Шесть экспертов обучали через online RL, затем объединили в одну модель.

Генеративные модели
- ChatGPT Images 2.5 — Более точечные правки и меньше искажений при последовательном редактировании. В Flare примерно в 1,9 раза быстрее Sunburst, но уступает по качеству.
- AuK — Tencent открыли генератор и редактор речи по текстовым инструкциям. Меняет слова, голос и эмоции в записи; есть веса и ComfyUI-ноды.
- Krea Agents — Агент для генерации контента с файловой системой, скиллами и моделями в одном интерфейсе.

Прочее
- Кому достаётся компьют — По оценке Epoch оценили кто является конечным пользователем вычислительных мощностей.
- Притормозите ИИ — Дарио Амодеи призвал замедлить развитие моделей. Кому выгодны такие призывы и при чём тут конкуренция.

> Читать дайджест #129

#дайджест
@ai_newz

Читать полностью…

эйай ньюз

OpenAI будут давать по бесплатному ресету всем подписчикам каждый день пока нет доступа к Astra. Такие ресеты можно применять в любой момент в течении месяца.

@ai_newz

Читать полностью…

эйай ньюз

Новая линейка моделей GigaEmbeddings в открытом доступе

Бесплатные модели под лицензией MIT, переводят текст в векторы для RAG-системы и поиска по смыслу. Стали сильнее на английском языке и особенно в задачах с кодом, получили поддержку vLLM и SGLang и подходят для разных требований к качеству и производительности. На выбор дали три размера — от совсем легкой 480M до флагмана на 10B.

При обучении гоняли открытые датасеты Nemotron, F2LLM и KALM, плюс использовали дистилляцию для младшей версии. В итоге 10B-A1.8B взяла первое место в ruMTEB и ускорила инференс в два раза, 3B прибавила 14,5 пункта в коде, а 480M стала лучшей на русском среди малопараметрических моделей.

@ai_newz

Читать полностью…

эйай ньюз

Встречайте GLM 5.3

Прирост по сравнению с 5.2 был достигнут иключительно масштабированием RL, причём упор был на RL на реальный задачах, вроде оптимизации тренировки модели. Внезапно такой подход дал очень хороший буст в кибербезопасности — компания заявляет что их модели смогли найти 2.5к уязвимостей с момента релиза GLM 5.2, причём самой старой уязвимости 45 лет. Весов пока что нет, обещают через две недели.

Блогпост

@ai_newz

Читать полностью…

эйай ньюз

Нейродайджест за неделю (#125)

LLM
- Веса Kimi K3 — Moonshot выложили веса крупнейшей открытой модели на 2.8T параметров (104B активных). Для локального запуска потребуется система с 2 ТБ памяти.
- Снижение цен на GPT 5.6 — OpenAI уронили цены: Luna подешевела в 5 раз ($0.2/$1.2), Terra — на 20%. Для флагмана Sol запустили Fast-режим (в 2.5 раза быстрее за 2x прайс).
- DeepSeek V4 Flash — Свежая версия 0731 в API обходит GLM 5.2 и совместима с Codex, оставаясь дешевле Luna и по токенам и в пересчете на таск. Релиз V4 Pro ждут в начале августа.
- Astra от OpenAI — Новая мультиагентная модель доказала 10 открытых математических задач при помощи Lean, потратив менее $2000 на токены по расценкам Sol.

Генеративные модели
- Seedance 2.5 — Генератор видео от ByteDance научился делать ролики до 180 секунд, получил интеграцию с Blender и точечное редактирование, но стал самым дорогим на рынке ($6 за 30 сек).

> Читать дайджест #124

#дайджест
@ai_newz

Читать полностью…

эйай ньюз

Слив Suno

Хакер под ником ellie.191 слил старые исходники Suno, и это подтвердило то, о чем все и так догадывались. Модель обучали, соскрэпив миллионы (а скорее всего десятки миллионов) треков и текстов с YouTube Music, Deezer, Genius, Pond5, Jamendo, Freesound и IMSLP. В слитых данных засветились исходники за 2023–2024 годы и скрипты для скрейпинга.

Только с YouTube Music стащили больше 2 миллионов клипов. Причем разработчики специально выкачивали акапеллы, чтобы получить чистый вокал для обучения. Для обхода защит ютуба Suno юзали сторонний сервис Bright Data, а в планах было выкачать миллион часов подкастов через PodcastIndex.

Suno защищаются тем, что териновать модели на копирайтных материалах, которые публично доступны в интернеты - это fair use (есть такое понятие в США).

Утечка произошла еще в ноябре 2025-го, но компания технично умолчала об этом. Под шумок утекли и данные клиентов: email, номера телефонов и платежная информация из Stripe. Suno оправдываются тем, что полных номеров карт у них не было, поэтому уведомлять пользователей по закону они были не обязаны.

Сейчас RIAA (Американская ассоциация звукозаписывающих компаний) как раз судится с Suno за нарушение копирайта, и этот слив для них настоящий подарок.

Статья на The Verge

@ai_newz

Читать полностью…

эйай ньюз

Anthropic продлили доступ к Fable 5 ещё на неделю

Кроме этого недельные лимиты на эту неделю увеличили на 50%. Интересно, сколько ещё раз они будут проворачивать этот трюк.

@ai_newz

Читать полностью…

эйай ньюз

GPT 5.6 уже раскатывают на всех пользователей

Sol будет доступен всем платным пользователям, Terra и Luna бесплатным. Вмест с релизом модели релизнули ChatGPT Work — ответ Claude Cowork, агент в ChatGPT для не-кодинговых задач. Второй заметный релиз — ChatGPT Sites, возможность публиковать мелкие сайтики сделанные при помощи ChatGPT, такой себе "у нас есть артефакты дома". Ну и Codex и ChatGPT это теперь одно приложение на десктопе.

@ai_newz

Читать полностью…

эйай ньюз

OpenAI показали GPT 5.6

Идёт в трёх вариантах: Sol, Terra и Luna. Sol это новый флагман, Terra примерно находится на уровне GPT 5.5, а Luna немного хуже 5.4. Sol стоит $5/$30 за миллион токенов, Terra $2.5/$15 и Luna $1/$6. Кэширование токенов теперь платное, такие промпты на 25% дороже, а скидка на кэшированные токены остаётся 90%.

Самая впечатляющая деталь этих моделей — GPT 5.6 Sol запустят на Cerebras в следующем месяце, на скорости в 750 токенов в секунду. Terra и Luna тоже хотелось бы там увидеть, но про них пока что ничего не говорят, как ничего не говорят и про цену.

Модель доступна лишь ограниченному количеству партнёров в США, пока OpenAI договариваются с правительством. Общую доступность обещают через несколько недель.

@ai_newz

Читать полностью…

эйай ньюз

Нейродайджест за неделю (#119)

LLM
- Claude 5 Fable — Anthropic выкатили общедоступную версию Mythos, но с неприятным сюрпризом: модель невидимо деградировала (тупела) при запросах, связанных с разработкой AI. После сильного возмущения комьюнити (включая мой пост в LinkedIn) компания признала ошибку и пообещала сделать ограничения прозрачными. Однако затем правительство США потребовало закрыть доступ всем не-гражданам из-за джейлбрейка, и Anthropic пришлось закрыть доступ вообще всем.
- DiffusionGemma — Google выпустили диффузионную версию Gemma 26B-A4B. Модель в 4 раза быстрее авторегрессионной (1000 токенов/сек на H100), хотя качество генерации текста пока отстаёт.
- Kimi K2.7 Code — Новая открытая модель для кодинга (триллион параметров). Работает лучше K2.6, используя на 30% меньше токенов.
- Релиз весов MiniMax M3 — Модель оказалась компактнее ожидаемого (428B параметров, 23B активных). Главная фишка — новый вариант sparse attention (MSA), который эффективнее GQA на больших контекстах.

Прочее
- Ручной сброс лимитов в Codex — OpenAI заменили глобальный сброс лимитов на ручную кнопку (раз в 30 дней). Запустили реферальную программу для получения дополнительных сбросов.
- Экономика подписок AI-сервисов — Безумные расходы на активных пользователей подписок.

> Читать дайджест #118

#дайджест
@ai_newz

Читать полностью…

эйай ньюз

LLM становятся частью рабочих процессов

Скиллы позволяют один раз задать порядок работы с документом или отчётом и затем его переиспользовать. Агенту не нужно повторять одни и те же инструкции в каждом запросе.

Голосовые агенты через Realtime API могут вести диалог и вызывать инструменты по ходу разговора, например искать по файлам или обращаться к CRM. Это позволяет связать разговор с данными и сервисами компании.

На Yandex Scale Яндекс показал оба направления. В AI Studio появились переиспользуемые навыки и новая модель синтеза речи. В Алисе AI Про собрали навыки и плагины, а внутренние сервисы можно подключать через MCP.

@ai_newz

Читать полностью…

эйай ньюз

Нейродайджест за неделю (#131)

LLM
- Siri AI — Apple запустила англоязычную бету с личным контекстом, пониманием экрана и действиями между приложениями.
- Gemini 3.8 Live — две голосовые модели с визуальным контекстом и фоновыми tool calls. Extended Thinking умеет рассуждать и говорить одновременно.
- Qwen3.8-Omni-Flash — принимает текст, изображения, аудио и видео, имеет контекст 1M и возвращает текст. Есть thinking, function calling и веб-поиск.
- Jev — модель TypeSafe вместо текста выдаёт типизированные решения с вероятностями. Заявленная задержка 70–500 мс, доступ пока ранний.

Генеративные модели
- Qwen-Image 2.1 — единая 7B-модель для генерации и редактирования в 2K. Поддерживает RGBA, до 10 референсов и локальные маски; веса доступны по research-лицензии.
- Vidu S2 — 720p-аватары и редактирование входящего видеопотока в реальном времени: замена персонажа, одежды, фона и стиля.
- Boreal — модель Creatify для рекламных text-to-video и image-to-video, дообученная на открытой LTX-2.5. Заявленная цена через fal — около $0,01 за секунду, но она ещё ждёт финального подтверждения.
- HiDream O1 Video — image-to-video модель с асинхронным API: принимает один референс и промпт, а длительность определяет сама либо фиксирует на 10 секундах.
- Enhance Frame Rate — инструмент Runway для готовых роликов: работает с видео до 4K, повышает частоту до 120 fps и сохраняет исходное разрешение.

Агенты и продукты
- Claude собрали воедино — чат, Cowork и Design объединяются; появились редактируемые Docs и Slides с экспортом в PDF и PowerPoint.
- ChatGPT в Office — один add-in работает в Word, Excel и PowerPoint, умеет править открытый файл и подтягивать контекст из подключённых приложений.
- Astra for Law — GPT-6 Astra получила юридический поиск по праву США и 26 интеграций. Доступ пока дают выбранным американским юрфирмам.
- Агенты в DaVinci — Resolve Studio 21.1 добавил интеграцию AI-ассистентов для работы с медиатекой, монтажом и рендером.

Безопасность и исследования
- Claude помог взломать OpenAI — Hacktron с помощью Opus построили эксплойт, а цепочка из RCE и ошибки SSO дала доступ к аккаунту сотрудника и внутреннему репозиторию. Уязвимости уже закрыты.
- Оценщик внутри Anthropic — Accenture — международная консалтинговая и технологическая компания, которая внедряет ИИ для бизнеса и государства. Её специализированное AI-подразделение Faculty получит доступ уровня сотрудника для red teaming и проверки safeguards; работу напрямую финансирует Anthropic.

> Читать дайджест #130

#дайджест
@ai_newz

Читать полностью…

эйай ньюз

GPT 6 Sol и Luna

Лучше чем 5.6, при этом в два раза дешевле и использует меньше лимитов Codex. Sol теперь стоит $2/$10 за миллион токенов, прямо как Sonnet. Цену Luna вообще скинули до $0.1/$0.5 за миллион токенов, то есть цену по сравнению с оригинальной 5.6 Luna сбросили в 10 раз. Ну и подписчикам завезли banked reset.

Блогпост

@ai_newz

Читать полностью…

эйай ньюз

Вышел Grok 4.7

Заметный прирост при той же цене и скорости. Маск ранее заявлял что Grok 4.7 должен быть новый претрейн на 2.1 триллиона параметров, но похоже планы поменялись. А тем временм Grok 4.8 с 2.5T параметров должен был закончить тренировку на прошлой неделе и, скорее всего, сейчас уже на стадии RL.

@ai_newz

Читать полностью…

эйай ньюз

Сейчас более рискованно оставаться в найме, чем делать свой стартап

Можно начать с малого: запустить свой небольшой IT-проект.

Но большинство застревает ещё до запуска:
• какую идею выбрать;
• где искать первых пользователей без бюджета;
• как не потратить полгода на продукт, который никто не купит.

В комьюнити Короче, капитан выработали формулу:
найти существующий спрос ➡️ собрать минимальную версию продукта ➡️ протестировать на реальных пользователя

И это работает в разных нишах:
— Парень в одиночку собрал Telegram-игру с AI и заработал около $1500 за первые полтора месяца;
— Девушка без навыков программирования запустила AI-бота для изучения английского и получила первые ~$200 уже в первый месяц;
— У другого участника коммьюнити сервис для тренировки китайского произношения вырос до $4000 в месяц без затрат на рекламу — за счёт Google и продвижения внутри сторов.

Это не истории про «гениальную идею» и миллионы через неделю. А примеры того, как маленький продукт можно запустить без команды и инвестиций. Получить результат, а уже потом решать, стоит ли его масштабировать.

В канале @its_capitan:
• разбирают такие проекты
• делятся реальными цифрами
• показывают, где были ошибки

Подписывайтесь, чтобы знать, как надо и НЕ надо запускать продукты.

#промо

Читать полностью…

эйай ньюз

😮 это все из-за нового гигачата - слишком мощным оказался )))

А если серьезно, то подумайте кому это выгодно – сдерживать своих конкурентов, а также раздувать хайп об угрозах AGI, перед выходом на IPO. AGI уже вот-вот появится, если прям ща все не запретить!))

Ну, а китацы точно клали болт на эти вопли в X, они ничего замедлять уж точно не собираются.

@ai_newz

Читать полностью…

эйай ньюз

Ну а тем временем HuggingFace 🤗 показали робо-утку за $399

https://pollen-robotics.com/microduck/

@ai_newz

Читать полностью…

эйай ньюз

Индустрия перепродажи подписок на нейросети

На площадке ggsel можно взять доступы к разным сервисам с хорошим дисконтом.

Сразу стоит понимать суть схемы. Это не белый сервис, а продажа "серых" аккаунтов от частных селлеров. Достаются они различными способами: через ботов, автореги и пр. По отзывам подписчиков, из-за такой подозрительной активности подписка может слететь в любой момент.

Но низкий прайс с лихвой перекрывает риски, будь то условный Gemini PRO или Adobe.

Из плюсов - спокойно проходит оплата по ру-картам.

Тема отлично спасает, если нужно много учёток для массового прожигания токенов, например в Codex, но не хочется руками регистрировать новые почты.

При таких копеечных затратах зачастую проще поднять новый аккаунт, чем пытаться выбить замену у продавца.

Но я ни в коем случае не агитирую пользоваться серыми схемами, т.к. это нарушает Terms of Use. Пишу этот пост чисто для информации.

ggsel

@ai_newz

Читать полностью…

эйай ньюз

Meta выпустила Muse Glimmer и пообещала открыть веса Muse Spark 1.2

Muse Glimmer это 30B мультимодальная модель, которая обходит по бенчам и Qwen 3.6 27B и Gemma 4 31B. Это первый заметный открытый LLM релиз от Meta с апреля 2025 года, ну а в такой весовой категории, модели компании не выпускались аж с Code Llama 34B в августе 2023.

Архитектурно это dense модель с относительно большим perception encoder. Главный очевидный минус — длина контекста всего 131к, что меньше чем у конкурентов.

Вместе с моделью выпустили официальные квантизации, так что модель влезает в 24 гигабайта VRAM. Вышла и официальная драфт модель, благодаря этому Muse Glimmer запускается на одной 5090 на скорости в 230 токенов в секунду.

Веса модели
Официальные квантизации

@ai_newz

Читать полностью…

эйай ньюз

Ищу Webflow-разработчика на креативный лендинг

Я для GenPeach AI ищу Webflow-разработчика, который сможет разработать лендинг примерно из семи блоков. Сайт уже существует на Webflow — поменяются контент, лейаут блоков и часть дизайн-элементов и анимаций. Новый дизайн предоставлю в формате макета в фигме.
Нужен синьорный специалист с опытом (3+ года) разработки креативных сайтов на Webflow с интерактивными элементами или анимацией и вниманием к деталям.

Требования к кандидату:
– Очень внимательный к деталям (отступы, цвета и т.д.)
– Быстро выполняет задачи
– Максимально прозрачен и быстро общается
– Ответственный (Всегда соблюдает договорённости и сроки)
– "Get shit done" mentality (don't bother me with issues, but with specific solutions)
Пара важных моментов:
– Вы должны иметь возможность принимать оплату на карту иностранного банка (вы живёте за пределами России и Беларуси).
– Availability: конец июля / ~начало августа.

Если это про вас, заполните вот эту небольшую анкету.

По вопросам можно писать на hr@genpeach.ai
Но перед тем, как задавать вопросы - заполните анкету.

@ai_newz

Читать полностью…

эйай ньюз

Сбер выкатил в опенсорс GigaAM Multilingual и GigaChat Audio

Статьи по архитектуре моделей уже приняли на Interspeech 2026. В релизах исправили две проблемы открытых Speech AI систем — слабую поддержку языков СНГ и деградацию качества на длинных аудио.

GigaAM Multilingual — мультиязычный стек для распознавания русского, казахского, киргизского, узбекского и английского. Тут две части: аудио-энкодер и CTC ASR. Энкодер обучали на 2 млн часов речи на 70+ языках, и он быстро адаптируется к новым доменам. На башкирском и грузинском его дообучили с одного датасета Common Voice до ошибки WER ~4% (у Whisper Encoder при тех же вводных — 11%+). А модель распознавания CTC ASR в версии на 240M параметров обходит Whisper Large v3 и Omnilingual 1B, хотя весит кратно меньше.

GigaChat Audio — это audio-native LLM на базе GigaAM Multilingual и GigaChat3.1-10B-A1.8B. Модель тянет до 2 часов контекста и умеет в temporal grounding — локализацию событий во времени с таймстемпами и суммаризацией интервалов. На длинных записях от 20 до 60 минут точность локализации IoU составляет 48.3, в то время как у Voxtral, Phi-4 и Qwen3-Omni результат близок к нулю. Вдобавок опубликовали датасет TimeGround-1M для обучения LLM привязке событий ко времени, а на RuBQ-Audio модель выбивает 60.0 (против 43.7 у Qwen3-Omni).

Полноразмерную GigaChat-Max-Audio уже добавили в ИИ-помощник ГигаЧат giga.chat, а распознавание голосовых сообщений работает в @smartspeech_sber_bot. Веса открытых моделей, датасет и статьи на arXiv уже в сети.

GigaAM Multilingual
GigaChat Audio

@ai_newz

Читать полностью…

эйай ньюз

Muse Image и Muse Video

Это первый релиз после ренейма Meta GenAI в Meta Superintelligence lab. И своего рода преемник моделей Emu.

По сути это что-то типа GPT-Image/Nano Banana, где очень тесно интегрирована диффузионная модель и LLM (потенцаильно шаря часть слоев). Модель теперь сама пишет Python-код и парсит веб для референсов (что уже было у NB). Наверняка все работает на базе Muse.

Показали ,как модель сначала пишет код для генерации фрактала, а затем чётко вставляет его на картинку, полезно для инфографики, теперь модель сначала построить график в питоне по вашим данным а затем ставит его в картинку и для менюшек в ресторанах, где нужна чёткая верстка, которую модель может сделать на условном html. Еще Muse сама исправляет косяки на сгенерированных картинках (типа Test-Time-Scaling, где делается несколько генераций и выбирается лучшая). Причём последняя фича якобы эмерджентно вылезла прямо при RL-тренировке.

В общем ещё одна нанобана, но с большим (?) ризонингом. На t2i арене попала на второе тректье место, совсем на тоненького опередив NB2 и Reve-2, но вчера выпущенный Reve-2.1 уже опять обскакал Muse.

На Image Edit Arena - тоже второе место, слегка обогнал MAI-image-2.5 (куда как раз ушла часть моей бывшей команды из Меты, в которой я работал раньше). На других аренах модели пока нет.

Без скандала не обошлось. Кто-то посчитал, что будет хорошей идеей генерить лица юзеров инсты просто по @-тегу (опция включена по дефолту), что не все оценили. Такого я, если честно, от Марка не ожидал 😅.

Видео-модель пока без агентов, но уже уверенно сидит в топ-3 лидербордов, обойдя happyhorse от Alibaba.

Блогпост - папиру, я думаю, можно не ждать
Потыкать модель можно пока только в американской инсте - у Меты занимает вечность, чтобы что-то выкатить на Европу.

@ai_newz

Читать полностью…

эйай ньюз

Meta выпустила Muse Spark 1.1

Новая версия лучше во всём, особенно прокачали агентный кодинг. Вместе с моделью Meta запустила свой API, цена за Muse Spark 1.1 — $1.25/$4.25 за миллион токенов, всем новым аккаунтам дают бесплатных 20 баксов API кредитов.

@ai_newz

Читать полностью…

эйай ньюз

Нативные 4K в SeeDance 2.0 и SeeDance 2.5

Пока мы спали, на конференции Volcengine FORCE ребята из ByteDance анонсировали SeeDance 2.5. Завезли поддержку аж до 50 мультимодальных референсов, включая 3D-модельки, редактирование по промпту и нативные 4K. В уже старый SeeDance 2.0, кстати, 4K к релизу тоже прикрутили.

Кроме того, после скандалов по IP, китайцы (на удивление) запускают полноценную платформу коммерциализации авторских прав, где правообладатели легально лицензируют контент под шаблоны ремиксов, а выручка честно пилится между сторонами. Первым в это дело вписался гонконгский режиссер Чжоу Синчи, и дневной объем генераций по его комедиям уже пробил отметку в 100 тысяч.

Еще под шумок обновили Seedream 5.0 Pro — в нем теперь можно послойно редактировать контент как в reve-2.0, а заодно подтянули и их модельку Seed-Audio 1.0. Еще на ивенте обновили семейство Seed до версии 2.1, но ллмки у них исторически так себе и тут ничего не изменилось.

Релиз SeeDance 2.5 планируется в июле.

@ai_newz

Читать полностью…

эйай ньюз

Хочу рассказать про моих друзей беларусов из стартапа GRAI

Ребята строят AI music lab и хотят сделать так, чтобы пользователи могли экспериментировать с музыкальными треками внутри приложения, например создавать ремиксы или изменять стиль мелодий. Тема интересная, так как до сих пор нет нормального социального приложения, где бы можно было угарать и креативить на базе существующих треков. В отличие от того же Suno, в GRAI заключают соглашения с музыкантами и лейблами, чтобы на легальной основе можно было делать ремиксы и не нарваться на нарушение авторских прав.

Так вот, GRAI недавно зарейзили $9M seed раунд (топ!) и сейчас хайрят Senior ML Engineer (RecSys для музыки) и Research Engineer (тренить аудио-модели), желательно с опытом в аудио генеративных моделях.

Ребята базируются в Варшаве, но готовы рассмотреть и remote. Один из фаундеров, Илья, уже делал exit - продал Vochi в Pinterest 4 года назад, что очень круто и говорит о том, что контора серьезная. Так что рекомендую!

Ну, а матерых спецов в Visual Gen AI милости просим закинуть заявку к нам в GenPeach AI 🙂

@ai_newz

Читать полностью…
Subscribe to a channel