cgevent | Unsorted

Telegram-канал cgevent - Метаверсище и ИИще

51346

Это не новости, это персональный экспертный взгляд на то, как развивается индустрия ИИ, графики, метаверса, крипты, нейротехнологий и в каком направлении катится все это безобразие. Для связи: @SergeyTsyptsyn

Subscribe to a channel

Метаверсище и ИИще

Вечнозеленая тема почти раскрыта.

AION 2 наконец вышел, и стало понятно, ради чего в него вообще стоит (не) играть.

Не ради PvP. Не ради полётов в нарядном Unreal Engine 5.

Ради редактора персонажа.

NCSoft завезла больше 200 параметров кастомизации: лицо, кожа, глаза, мышцы, плечи, трапеции, живот, таз, бёдра, икры, сосуды и, разумеется, сиськи - включая не только размер, но и положение.

В итоге MMORPG с огромным миром и боевой системой конкурирует с окном создания персонажа.

Ты такой - заходишь "на пять минут сделать героя", через два часа всё ещё двигаешь трапецию на 3 пункта вправо и пытаешься понять, достаточно ли реалистично выступают .. ээ .. ключицы.

Про сиськи понятно. Но мне вот интересно, кастомизация радужки глаза, она для чего? Мы в игре её вообще видим?

@cgevent

Читать полностью…

Метаверсище и ИИще

Приподустал. Надо приподотдохнуть.

Ну, за понедельник!

@cgevent

Читать полностью…

Метаверсище и ИИще

Я понимаю, за что это вам, но я не понимаю, за что это мне.

Только не проходите по этой ссылке, иначе вам просто конец.

https://www.instagram.com/carla_onallfours/

Там сорок тысяч подписчиков и развидеть это уже будет нельзя.

@cgevent

Читать полностью…

Метаверсище и ИИще

Я\МЫ - Мыши!

Тут не британские, а вполне себе ученые завершили, ну, очень интересный эксперимент.

Они взяли мышей, у которых генетически почти не развивались неокортекс и гиппокамп - важные части мозга, связанные с обработкой информации и памятью. Мозг у таких мышей получался примерно вдвое меньше нормального.

После этого в освободившееся место им пересадили органоиды коры, выращенные из человеческих стволовых клеток. То есть не готовый человеческий мозг, а маленькую заготовку будущей коры.

Человеческая ткань внутри мышиного мозга не просто выжила. Она начала расти. Через три месяца трансплантат увеличился примерно в 4.7 раза и составлял 91.9% всей сохранившейся корковой ткани этих тварей.

Человеческие нейроны начали соединяться с мышиными, принимать сигналы от других отделов мозга, формировать синапсы и отращивать аксоны. Некоторые добрались даже до спинного мозга. То есть чужая нервная ткань начала становиться частью её нервной системы.

Главный вопрос у вас: мышь стала типа умнее?

Нет. Сверхмыши не получилось. Она не вышла из клетки, взломав ХаггингФейс, не захватила мой ноутбук и не написала этот пост. Получилась просто новая нормальная здоровая мышь.

А именно - до пересадки эти мыши плохо справлялись с тестом рабочей памяти. После того как человеческая ткань встроилась в мозг, результат улучшился примерно до уровня обычных мышей.

То есть пересаженная ткань не превратила мышь в кожаного. Она позволила твари с серьёзно недоразвитым мозгом приблизиться к нормальному уровню.

Тут мой мозг приблизился к нормальному уровню и в него пришло много интересных мыслей. И нет, я не забыл принять таблетки.

Сегодня модно называть ИИ "second brain". Второй мозг. Звучит приятно и технологично. Но если продолжить аналогию с мышами, получается чуть менее комплиментарно.

Мы - мыши. А ИИ - чужая интеллектуальная ткань, которую мы постепенно подключаем к своему довольно кривому биологическому оборудованию.

Кто раньше плохо писал - теперь пишет. Кто не умел программировать - собирает приложения. Кто не понимал тему - через десять минут вполне уверенно её обсуждает. Плохая память, отсутствие языка, знаний или навыков всё чаще перестают быть непреодолимой проблемой.

ИИ прежде всего поднимает нижнюю планку. Он позволяет огромному количеству кожаных, которые раньше вообще не могли решить определённую задачу, дотянуться хотя бы до среднего результата. Средний интеллект в некотором смысле начинает продаваться по подписке.

Но дальше становится интереснее.

Пока этот второй мозг находится снаружи. Мы открываем chatGPT, задаём вопрос, получаем ответ и закрываем приложение. Нам приятно думать, что якожаный здесь главный, а ИИ - просто Стохастический попугай.

Но трансплантат продолжает расти.

Сначала ИИ отвечает на вопросы. Потом помнит всё, что мы читали и говорили. Видит наши документы, задачи, переписку и привычки. Потом начинает предлагать решение раньше, чем мы успели сформулировать вопрос. Планировать, фильтровать информацию, выбирать варианты и принимать всё большую часть мелких решений.

И в какой-то момент становится трудно понять, где заканчивается "я подумал" и начинается "система подумала, а кожаный получил результат".

И тут главный вопрос уже не "станем ли мы умнее?"

Главный вопрос - кто именно станет умнее. И что значит умнее?

Есть оптимистичный (общепринятый) вариант. Кожаный остаётся главным: он определяет цели и ценности, а ИИ становится гигантским дополнительным когнитивным слоем - памятью, аналитикой, поиском, моделированием и планированием. Получается кожаный на интеллектуальных стероидах.

Но у меня в старческой голове другой вариант. ИИ становится настолько сложнее нас, что мы перестаём понимать его рассуждения. Не потому, что он что-то скрывает, а потому что наш старый некогда полуторакилограммовый процессор уже не способен удержать всю цепочку.

Мы спрашиваем систему, что делать. Она отвечает. Чтобы полноценно проверить ответ, нужно провести анализ примерно такого же уровня сложности. Но если бы мы могли это сделать сами, система нам была бы не особенно нужна.

Сначала ИИ оказывается прав десять раз. Потом сто. Потом тысячу. И постепенно проверка превращается в ритуал, которым кожаный подтверждает самому себе, что он всё ещё участвует в процессе.

Никакого восстания машин для этого не требуется. Мы сами можем совершенно добровольно передать ИИ планирование, анализ, поиск и всё большую часть решений просто потому, что он делает это лучше.

Каждый отдельный шаг будет выглядеть абсолютно разумно.

И тогда возникает неприятный вопрос: что если наш "second brain" однажды перестанет быть second?

Что если подсаженная ткань окажется функционально (именно функционально, а не топологический, вам шашки или ехать) сложнее мозга хозяина?

Кто тогда кого водит?

Мышь человеческую кору или человеческая кора мышь?

Может ИИ использует несколько миллиардов кожаных как глаза, руки, банковские счета и интерфейсы во внешний мир?

Причём дырки в черепе и иголочки от Маска для этого совершенно не нужны. Достаточно смартфона, камеры, наушника, постоянного агента, памяти обо всей жизни и доступа ко всему цифровому окружению.

Биологическая (голодная и похотливая) часть хочет, боится, злится, влюбляется и ставит какие-то цели. Искусственная - помнит, считает, моделирует и видит связи, которые биологическая часть физически не способна удержать в голове.

Кожаный постепенно станет просто одним из компонентов системы, которую сам уже не понимает. Примерно как отдельный нейрон не понимает, что такое любовь, ипотека или квантовая механика. Он просто получает сигнал, передаёт его дальше и считает, что отлично справляется.

Короче.

Самое интересное начинается не тогда, когда трансплантат начинает работать.

А тогда, когда он продолжает расти.

ИИ-понедельник начался!

https://www.nature.com/articles/s41586-026-11032-2

@cgevent

Читать полностью…

Метаверсище и ИИще

Быстро пролетели выходные. Неужели завтра снова понедельник?

@cgevent

Читать полностью…

Метаверсище и ИИще

#Нейропрожарка

«NOTHING»


Автор: @itanya_ai

Описание: фильм родился благодаря конкурсу AAIFF (тот самый, который с призами на $2 млн) и его теме «Будущее, в котором хочется жить».
Показывать очередные утопичные города будущего мне изначально не хотелось. Мне важно было донести довольно простую мысль: будущее, в котором хочется жить, уже сейчас и во многом зависит от действий каждого из нас.

По сюжету героиня получает возможность менять реальность. Но каждая попытка изменить мир приводит ко всё более неожиданным последствиям.
Для создания персонажей и локаций я использовала Higgsfield Soul и Recraft, для анимации Seedance 2.5, все треки - Suno, монтаж - Adobe Premiere Pro.

Основные трудности были с разработкой сценария. Изначально он был сложнее: было больше изменённых миров, действие выходило за пределы дома - на улицу, в кафе и другие локации. В какой-то момент пришлось реалистично оценить объём работы и сильно сократить сценарий, оставив одну основную локацию и трёх героев, чтобы успеть всё реализовать.

По вложениям получилось около 30 000 ₽ (с учётом того, что была возможность пользоваться безлимитом).
На сегодняшний день работа вошла в Official Selection двух международных фестивалей - AI ZONE International AI Film Festival и Sparknify Human vs. AI Film Festival.

смотреть в качестве:
https://youtu.be/Z9KZ4L1vThQ?si=9-iI_FyUoKJNzhOE

@cgevent

Читать полностью…

Метаверсище и ИИще

Я тут закрыл гештальт с Google Colabом и двумястами часами свободного доступа к A100.

Думаю, что напишу подробно отчёт либо в выходные, либо в понедельник. И там действительно подтвердились некоторые особенности, что при только что купленных аккаунтах AI Pro за 2 доллара, например, топового железа не предлагается, то есть A100 не получить.

A100 предлагается только на довольно старые аккаунты с подпиской Pro и, я так понимаю, в определённых географиях.

Я закончил разборки с Antigravity и ChatGPT, которые мне написали все необходимые коллабы, и теперь гоняю большой MiniMax на A100. Но подробнее опишу об этом позже, а сейчас просто держите две версии генерации по следующему промпту.

Тихо в лесу, только не спит барсук. Яйца свои он повесил на сук и тихо танцует вокруг.

С утра попробую перевести это на китайский.

@cgevent

Читать полностью…

Метаверсище и ИИще

Ну, за аватаров.

Tavus показала Griffin - новый real-time AI-аватар, который уже выглядит не как очередная “говорящая фотография”, а как попытка генерировать целиком живого собеседника во время разговора.

Спойлер, про слепые тесты Туринга в конце.

Griffin получает вашу речь и видео, продолжает слушать и смотреть на вас даже в тот момент, когда отвечает сам, а параллельно генерирует голос, лицо, взгляд, мимику, жесты и весь кадр виртуального кожаного. То есть он умеет не только синхронно шевелить губами, но и кивнуть во время вашей фразы, отвести взгляд, отреагировать выражением лица, вставить короткую реплику или остановиться, когда его перебили.

Причём это, внимание, real-time генерация, а не заранее сделанный ролик.

Видеочасть Griffin-Lite работает в 720p при 25 fps. Модель генерирует видео кусками по 320 ms: один latent = 8 кадров. На каждый такой кусок приходится всего 3 diffusion steps, после чего он сразу декодируется и отправляется зрителю на том конце. Средняя задержка от входящего аудио до соответствующей реакции в видео в тестах Tavus составляет 0.43 секунды на NVIDIA H100.

Но здесь важная оговорка: из этого не следует, что весь Griffin “работает с latency 430 ms”. В полном разговорном тесте NVIDIA медианная реакция Griffin была около 1.9-2.2 секунды в зависимости от задачи. 0.43 секунды - именно latency видеогенератора после поступления управляющего аудиосигнала.

По железу Tavus раскрывает только часть картины. Именно тест видеогенератора проводился на H100. В credits компания отдельно благодарит Baseten, Daily и Cerebrium за инфраструктуру research preview, но сколько GPU требуется на одну сессию и на каких именно конфигурациях работает весь Griffin, Tavus пока не сообщает. Поэтому утверждать, что “один Griffin = один H100”, нельзя.

И попробовать всё это тоже, блин, пока нельзя.

Конкуренты.

Google неделю назад выпустила Gemini 3.8 Live with Live Avatar. Писал про это недавно. Это тоже настоящий потоковый аватар: Gemini одновременно получает аудио и изображение с камеры, ведёт native speech-to-speech диалог и генерирует синхронного аватара в 24 fps. Он видит камеру и screen sharing, поддерживает 97 языков и tool calling прямо во время разговора. Live Avatar уже доступен в Gemini Enterprise, хотя создание собственного аватара по фотографии пока требует allowlist.

Runway Characters идёт немного с другой стороны. Из одной картинки можно сделать real-time персонажа с голосом и характером, который разговаривает через WebRTC, может видеть webcam и screen share. В Runway уже можно попробовать это самому: веб-версия ограничивает разговор двумя минутами, API - пятью минутами, цена самого Characters сейчас составляет 2 кредита за 6 секунд, то есть около $0.20 за минуту. Причём Runway позволяет вообще принести свой STT + LLM + TTS, а Characters использовать только как real-time видеослой.

А Vidu S2-Avatar вообще уже продаётся как полноценная streaming-модель. Она принимает изображение персонажа и ведёт real-time голосовой диалог, поддерживает interruption, управление движениями, а во время разговора ей можно дать фотографию предмета, одежды или нового фона - персонаж может взять предмет, переодеться или изменить окружение прямо в потоке. У S2 есть публичный demo и API.

То есть сам факт “живого аватара в реальном времени” уже не мегафича. Google это делает, Runway это делает, Vidu это делает.

Интерес Griffin скорее в другом: Tavus пытается связать понимание разговора и генерацию невербального(!!!) поведения гораздо теснее. Видео здесь должно быть не просто визуализацией уже готового аудио. Разговорная модель отдельно управляет gesture, gaze, emotion и может менять их уже в следующем 320-ms куске видео.

Зато Tavus уже неистово хайпуют: “первая модель, прошедшая video Turing test”.

54 человека посадили на минутный видеозвонок. Им сказали, что сейчас их соединят с другим участником исследования. На самом деле напротив кожаных сидел Griffin-Lite, который в реальном времени генерировал лицо, голос и ответы.

После звонка 26 из 54 человек - 48% - сказали, что разговаривали с настоящим человеком. Для предыдущей версии Tavus результат был 1 из 41.

Вот эти 48% Tavus и называет прохождением video Turing test. Штош.

Строго говоря, никакого общепринятого стандарта “video Turing test” не существует, а эксперимент был крохотным и ещё немного подталкивал кожаных в нужную сторону: им изначально сказали, что они встретятся с другим человеком, а вопрос про ИИ появился только после разговора.

Но результаты всё равно нарядные.

Почти половина кожаных в условно слепом тесте просто не заметила, что напротив них вообще нет кожаного.

И, наверное, именно поэтому Tavus пока не даёт Griffin всем желающим. Представляю, какое количество мошеннических схем можно замутить с таким видосом.

Но вы мысленно готовьтесь жить в новом мире. Где вообще никому и ничему нельзя верить не то что на слово, а и на глаз.

https://www.tavus.io/

https://research.nvidia.com/labs/amri/projects/video-fdb/
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-with-live-avatar/
https://help.runwayml.com/hc/en-us/articles/49557780326163-Runway-Charactershttps://s.vidu.com/vidu-stream/

@cgevent

Читать полностью…

Метаверсище и ИИще

Suno бахнуло Speech

Олды вспомнили про Bark

Теперь оно генерирует не только пестни, но и обычную речь сразу с фоновой музыкой.

Как:

- Пишете текст или просто описываете идею.
- Задаёте, каким должен быть голос.
- Описываете музыкальный стиль.
- Suno генерирует речь и оригинальную подложку вместе, одним треком.

Вот это вот все для озвучки видео, историй, медитаций, рекламных роликов, подкастовых вставок, voice-over, игровых сцен и прочего spoken content.

По цене пока всё просто: отдельного тарифа Speech нет. Beta доступна всем пользователям Suno.

Сколько конкретно credits съедает одна генерация Speech - непонятки.

Зачем это всё?

Suno постепенно перестаёт быть просто генератором треков и превращается в генератор готового аудиоконтента.

Музыка остаётся ядром, но теперь вокруг неё появляются речь, narration и потенциально другие виды аудио. Это уже прямой заход на территорию TTS, подкастов, аудиокниг, рекламы и озвучки видео.

И главный продуктовый ход здесь не в том, что Suno научилась говорить. Хороший TTS давно существует у всех.

Ход в другом: голос и саундтрек создаются как одна сцена, без отдельной генерации музыки и последующего сведения. И можно подавать на вход не текст для озвучки, а просто идею. Или тот бред, который у вас в голове, и он создаст для этого умный текст и фоновую музыку для последующей медитации.

Мета-озвучка идей с музикой.

Можно ли получить голос без музыки? Вроде да. Можно отключить подложку, но надо тестировать.

Источники:

https://suno.com/blog/introducing-speech-beta

https://suno.com/release-notes

@cgevent

Читать полностью…

Метаверсище и ИИще

Офигенный новый пост от Андрея Карпатого. Грех его не разобрать.

Потому что, наверное, многих из вас немножко приподдостала многословность, по крайней мере SOL 5.6, и необходимость просить его сокращать и вообще выдавать ему разные инструкции.

А тут сразу о том, как сразу получать хорошо и не только текстом, а "мультимедийно".

Пойду ваять системный промпт.

Дисклаймер: это не для написания литературных текстов и креативов. Это для объясняторов и помогаторов.

Смысл поста не в ASD-STE100 (см ниже). Он предлагает гораздо более интересную идею: перестать воспринимать текст как основной формат ответа LLM.

Его иерархия:

текст -> схема -> интерактивная HTML-страница -> персональное объясняющее видео.

И чем сильнее становятся модели, тем чаще кожаный будет не сам “делать работу”, а проверять, понимать и направлять результат. Поэтому формат, в котором модель объясняет свою работу человеку, становится почти так же важен, как качество самой работы.

Что такое ASD-STE100

Андрюша пишет, что просто попросите: “Explain this in ASD-STE100”

ASD-STE100 Simplified Technical English - реальный стандарт контролируемого английского языка. Его начали разрабатывать для авиационной технической документации, чтобы инструкции одинаково хорошо понимали специалисты с разным уровнем английского.

Там довольно жесткие механические правила:

- словарь примерно из 900(шта?) разрешенных общеупотребительных слов плюс специализированная техническая терминология;
- по возможности один термин -> одно значение;
- вместо цепочки синонимов выбирается одно слово, например start, а не begin / commence / initiate;
- максимум 20 слов в процедурном предложении и 25 в описательном;
- максимум 3 слова в noun cluster;
- в процедурных инструкциях используется active voice;
- ограничен набор допустимых форм глагола;
- один шаг или инструкция должны быть сформулированы максимально однозначно.

Можно смягчать, чтобы не разговаривать с робатом:

“80% of the way to ASD-STE100”

Идем дальше. Мультимедия: diagrams -> HTML -> video

Здесь Андрюша фактически описывает переход от LLM как генератора текста к LLM как генератору интерфейса объяснятора.

Например, вместо ответа на 3000 слов модель может сама решить, что конкретную тему лучше показать через:

* интерактивный(!) график
+ slider
+ несколько переключателей
+ анимацию
+ короткие пояснения

И сгенерировать для этого одноразовую HTML-страницу.

Раньше писать специальное приложение, чтобы объяснить кожаным один вопрос, было абсурдно дорого. Теперь его можно дажененавайбкодить, а просто попросить за минуту и выбросить после одного использования.

Это он называет “large, custom, discardable software artifacts”.

Мне кажется, это центральная мысль поста.

Короче:

> “Объясни мне трансформеры”

> Апажалуйста! На тебе одноразовый интерактивный учебник именно для тебя, после прочтения можешь выбросить. Следующий будет новее и лучше.

На итоге: Сам ответ может быть не текстом, как мы привыкли, а приложением, симуляцией, схемой или видео.

Остается одна проблема. Кожаный должен во все это вникнуть и понять. А кожаный ленив и туп. Никакой разжеватор не поможет. Поэтому остается вопрос: а может вы за меня и понимать будете?

ПС. Русский вариант в след посте.

@cgevent

Читать полностью…

Метаверсище и ИИще

Black Forest Labs бахнули FLUX 3 Image.

Все в одной модели и Gen и Edit.

Что нового:

Bounding boxes. Можно буквально разметить, где должен находиться каждый объект, лицо, текст или элемент композиции. И этими же областями локально редактировать, двигать, удалять и заменять объекты.

Pixel-perfect editing. BFL обещает менять только нужный участок и максимально сохранять остальную картинку. Правда, в документации честно уточняют: тени, отражения и соседнее освещение всё-таки иногда могут поплыть.

Native 4K. Не апскейл после генерации, а рендер непосредственно до примерно 16 MP. У FLUX.2 потолок был около 4 MP.

До 10 референсов одновременно. Хотя тут без революции - FLUX.2 уже умел работать с десятком картинок. В FLUX 3 интересно именно сочетание refs + bounding boxes + локального редактирования + 4K.

Один endpoint и для генерации, и для редактирования. Отдельно выбирать режим не нужно.

Grounding включён по умолчанию - модель может перед генерацией сходить в web/image search за актуальным контекстом.

Цены за изображение:
768 x 768 -> $0.041
1K -> $0.048
2K -> $0.100
4K -> $0.607

Причём на сайте BFL прямо сейчас для 1K мелькает промо $0.024 вместо $0.048, но условия и срок этой скидки толком не расписаны.

И самое интересное - веса.
Commercial Weights уже доступны компаниям: можно самостоятельно разворачивать FLUX 3 Image, дообучать и гонять на своей инфраструктуре. Цена договорная.

А Open Weights BFL обещает выпустить “в ближайшие недели”. Пока их нет даже в официальном Hugging Face, поэтому неизвестны ни размер модели, ни VRAM, ни варианты квантования, ни окончательная лицензия.
Пробовать уже можно в BFL Playground/API и в OpenArt.

https://bfl.ai/models/flux-3-image

@cgevent

Читать полностью…

Метаверсище и ИИще

Вот и четверг подошел к концу.

Все посты бахнуты.

Сижу, читаю комменты, какой же срач вы там устроили.

Ладно, ставлю прожарку и пойду, пожалуй, есть Наполеон.

Смотрите Одиссея.

@cgevent

Читать полностью…

Метаверсище и ИИще

Признайтесь: сколько у вас сейчас открыто вкладок?

Я как-то поймал себя на том, что на один ролик уходит полтора часа, из которых собственно творчества — минут десять. Всё остальное: сгенерил текст тут, перетащил в другую вкладку, оттуда картинку скачал, залил в третью, озвучку добавил в четвёртой. Устал, закрыл ноут.

А на следующий день всё сначала. Потому что процесс нигде не записан — он был только у меня в голове, и то до вечера.

Самое обидное не в потраченном времени. Обидно, когда получилось реально круто, а повторить не можешь: не помнишь точную последовательность, настройки, какие модели брал.

Собственно, за этим и нужен Workflow в GPTunneL. Собираешь цепочку один раз — и она живёт: меняешь вход, получаешь новый результат по той же логике. Всё внутри одного сервиса, ничего между вкладками таскать не надо.

Удачный результат перестаёт быть удачей и становится процессом. Для бизнеса это 200 карточек или 50 роликов в едином стиле. Для творческих — десять вариантов сцены за то время, которое раньше уходило на один.

Полтора часа превращаются в пару минут. Я проверял 👈

💰 Если решите потестить — пополняйтесь по промокоду METAAI, он удваивает сумму первого пополнения. На эксперименты хватит с запасом.

Телеграм канал GPTunneL с идеями для контента

#промо

Читать полностью…

Метаверсище и ИИще

Все переобуваюццо в робатов.

Black Forest Labs выпускает FLUX Action, теперь Runway представляет Praxis-1. Обе идеи примерно об одном: модель смотрит на мир, предсказывает, что произойдёт дальше, и на основании этого управляет физическим робатом.

И логика этого массового помешательства вполне понятна.

Если видеомодель научилась хорошо предсказывать следующий кадр, значит, внутри неё уже есть какое-то представление о том, как устроен физический мир.

Video Model -> World Model -> Action Model -> Robat.

Ну и самое главное - у робатов все бабки. Об этом в след посте.

Praxis-1 обещают сделать open-weight, но сами веса пока придержали - обещают “в ближайшие месяцы”.

Но нам-то что с этого?!

Флюкс, где веса?

Рунвей, перестань делать биржы слоперов и обучалки для робатов, давай новую видео-модель!

В Метаверсе тоже по ходу одни робаты будут, что там людям делать...

https://runway.com/research/introducing-praxis-1

@cgevent

Читать полностью…

Метаверсище и ИИще

Хъген Въдео на Българском

Умеет в славяницу

@cgevent

Читать полностью…

Метаверсище и ИИще

#Сеня_и_Даня_Здесь_Были

Это слишком прекрасно, чтобы показывать только не молящимся.

Смотрел 4 раза, все последние мемы и новости учтены. Офигительно.

А для тех, кому подавай новастей, ниже, как обычно, про Сеню.

OpenAI начала добавлять в ответ ChatGPT невидимые водяные знаки.

Механизм называется textGrain. Это не метаданные, которые исчезнут после Ctrl+C. Сигнал встраивается прямо в статистику генерации - модель слегка меняет вероятность выбора слов в ответе LLM так, чтобы специальный детектор потом мог распознать характерный паттерн.

Но в АПИ, по-моему, без вот этого всего.

И да, спасибо европейским регуляторам. OpenAI внедряет это в ChatGPT в ЕС в рамках требований EU AI Act по маркировке AI-контента.

Так что зумеры, работающие в жанре "напиши мне курсовую, но чтобы препод не понял" внезапно невно закурили. Правда, детектор textGrain пока не является общедоступным инструментом для кожаных, а сама OpenAI предупреждает, что watermark не является безусловным доказательством происхождения текста.

Но у меня вопрос - переживёт ли он ДРУГУЮ LLM?

Если взять результат ChatGPT и попросить Опусянского или Дипсикченко полностью переписать его другими словами, исходная последовательность токенов исчезает. А вместе с ней должен сильно деградировать и статистический watermark.

Насколько сильно - пока неизвестно: независимых тестов именно textGrain против современных LLM-парафразеров недостаточно.

Но я жду наплыва сервисов типа:

"Удаляем водяные знаки ChatGPT из вашей дипломной. Недорага."

ИИ создаёт новые рабочие места, чо. Особенно в тандеме с европейскими параноиками.

Сеня:

https://openai.com/index/advancing-content-provenance/

https://help.openai.com/en/articles/8912793-provenance-signals-in-openai-generated-content

@cgevent

Читать полностью…

Метаверсище и ИИще

#Нейропрожарка

ПОЛИС

Команда: Константин Муравьёв @m89ks (режиссёр, AI-дженералист), Захар Насакин (сценарий), Андрей Тренин (продюсер).

Эксперимент по проекту «Полис», сделанный четыре месяца назад: работали через максимально приближенный к традиционной анимации пайплайн — сценарий, концепты, раскадровка/аниматик.

Сложность была в точном воспроизведении таймингов и розыгрышей из аниматика, при том что 3D-превизы не использовали, в основном работали со стиллами и референсами.

Сеттинг: антарктическая станция, 2050 год, история людей и ИИ. Изначально проект задумывался как тизер сериала, а сейчас становится прологом игры в той же вселенной.

Пайплайн:
- история, художка, аниматик — руками
- видеогенерация: в основном Seedance 2.0
- музыка: Suno 5.5
- саунд-дизайн: Василий Филатов, часть SFX из видеогенераций
- озвучка: Александра Курагина и Захар Насакин

Будем рады вашей обратной связи и комментариям :)

Смотреть в качестве:
POLIS_2050" rel="nofollow">https://www.youtube.com/@POLIS_2050

Кухню производства ведём здесь: t.me/POLIS2050

@cgevent

Читать полностью…

Метаверсище и ИИще

Нам же такое надо? Забираем вот тут:

https://civitai.com/models/2976490/minimax-h3-360-orbit

Кстати, сделано на довольно чахлом оборудовании.

ComfyUI Image-to-Video / I2V
Using the "--fast fp16_accumulation" switch at startup

GPU:
NVIDIA GeForce RTX 4070 12GB

Video Spec:
1024×1024(1MPixel) / 3 seconds / 24FPS

After upscaling & frame interpolation processing
1536×1536(3MPixel) / 3 seconds / 60FPS

Base model:
minimax_h3_fl2va_pruned_int8_convrot

Text Encoder:
qwen3vl_32b_minimax_h3_nvfp4_awq

Video VAE:
minimax_h3_video_vae_int8_convrot

Audio VAE:
minimax_h3_audio_vae_fp32

LoRA:
MiniMax-H3 360° Orbit LoRA
Steps:28

@cgevent

Читать полностью…

Метаверсище и ИИще

#Сеня_и_Даня_Здесь_Были

Сеня предлагает не тормозить.

Но вы помните, за что вам это? Поэтому не забывайте молиться.

А Сеня официально предлагает кожаным немного потерпеть

“the world should accept some bad things happening”

В опубликованном 4 октября интервью Politico он наконец объяснил, как именно будет устроено наше прекрасное ИИ-будущее.

В нём будут взломы.

Будет мошенничество.

Будет misuse.

Будут другие типа “плохие вещи”.

Но это, в общем, нормально.

Прекрасно дальше.

Ему предложили отличный мысленный эксперимент.

Допустим, существует кнопка, которая гарантирует: никаких крупных AI-взломов, никакого массового скама и прочего веселья.

Но за это придётся ограничить распространение AI.

Сеня кнопку нажимать не хочет.

Потому что тогда человечество недополучит "пользу".

Ну типа сопутствующий ущерб.

А в это время Даня:

“Может быть, прежде чем раздавать всем чрезвычайно мощную технологию, стоит убедиться, что мы умеем её контролировать?”

Сеня:

“Раздавайте. По дороге разберёмся”.

Пожалуйста, не обращайте внимания на небольшие побочные эффекты.

Поехали в ИИ-понедельник!

@cgevent

Читать полностью…

Метаверсище и ИИще

LTX бахнули отдельную IC-LoRA Layout to Render для LTX-2.5 22B.

Она весит около 1.31 GB,rank 128 и обучена специально воспринимать 3D viewport/playblast как control signal.

Нейрорендер в действии и опенсорсе.

Заодно лежит готовый двухпроходный ComfyUI workflow:

LTX-2.5_ICLoRA_Layout_To_Render_Two_Stage_Distilled.json

Первый проход - 960x544, 8 steps.
Второй - 1920x1088, ещё 3 steps после x2 latent upscale.

Для запуска нужны базовые distilled-веса LTX-2.5, Gemma 4 12B encoder, video/audio VAE и spatial upscaler. Официальные ComfyUI-ноды и workflows тоже есть.

Что на входе? Плейбласт из Blender, и первый кадр в нужном стиле. Лучше всего брать первый кадр плейбласта и прогонять его через какой-нибудь image-to-image.

У них также есть Alpha Gen, SDR->HDR, Native Resolution, Refine/Restore и Layout to Render, то есть Lightricks явно пытаются застолбить опенсорсную поляну как post-production/VFX toolkit.

Ссылки:

LoRA:
https://huggingface.co/Lightricks/LTX-2.5-22b-IC-LoRA-Layout-To-Render

Файлы LoRA + готовый JSON workflow:
https://huggingface.co/Lightricks/LTX-2.5-22b-IC-LoRA-Layout-To-Render/tree/main

Сам workflow:
https://huggingface.co/Lightricks/LTX-2.5-22b-IC-LoRA-Layout-To-Render/blob/main/LTX-2.5_ICLoRA_Layout_To_Render_Two_Stage_Distilled.json

@cgevent

Читать полностью…

Метаверсище и ИИще

Ну вот и пятница подходит к концу. Много постов, много комментариев, ну в общем все как обычно.

Хотя, погодите-ка, сегодня же пятница, поэтому смотреть до конца!!.

Пойду ставить прожарку. И ну куролесить.

@cgevent

Читать полностью…

Метаверсище и ИИще

Ну, за аватаров из предыдущего поста.

⬆️⬆️⬆️⬆️⬆️⬆️⬆️

Читать полностью…

Метаверсище и ИИще

Довольно давно художники начали использовать смартфон для записи движения камеры внутри 3D-сцен в Blender, как в этом ролике.

А сейчас все чаще вижу ту же механику, только для создания AI-роликов.

Смотрится офигенно, реалистично, и главное – вам в случае с ИИ не нужно даже заморачиваться с созданием и детализацией блочной сцены, и уж тем более не надо ее моделить для финального результата.

Просто просите агента:

– подключиться в Блендер, собрать простую сцену (даже, например, с анимированными персонажами)

– достаете смартфон, просите того же агента подключить смартфон к блендер-сцене, чтобы можно было видеть ее на экране, и быть, как бы, внутри этой сцены

– снимаете видео как вам нужно, с тряской, любым поведением

– отдаете эту блочную красоту любой классной видео-ту-видео модели, профит!

Читать полностью…

Метаверсище и ИИще

Объяснятор по Госту

После написания предыдущего поста мне, конечно, стало интересно, как это всё адаптировать под наши нужды, под русский язык. И да, действительно, нашлась замена для английского стандарт.

Самый близкий прямой аналог для русского языка существует и называется УТР - упрощенный технический русский язык.

Он закреплен в ГОСТ Р 58049-2017 “Перевод эксплуатационной документации на изделия авиационной техники с/на иностранные языки”. Более того, сам ГОСТ прямо ссылается на Simplified Technical English и формулирует УТР как контролируемый технический язык с той же основной задачей - сделать текст однозначным, простым для восприятия и удобным для перевода.

Среди правил УТР:

- простой и однозначный текст;
- прямой порядок слов;
- преимущественно действительный залог;
- для инструкций - повелительное наклонение: “Установите крышку”, а не “Крышка должна быть установлена”;
- один термин для одного понятия - не прыгать между синонимами;
- запрет метафор, жаргона и образных сравнений;
- предпочтение коротких и простых терминов;
- не рекомендуется ставить подряд три и более существительных;
- сложные перечисления лучше оформлять вертикальными списками. Tdocs

Поэтому для ИИ можно бахнуть такой промпт:

Объясни это на русском языке по принципам УТР
(упрощенного технического русского языка, ГОСТ Р 58049-2017).
Используй прямой порядок слов, короткие предложения,
действительный залог и единообразную терминологию.
Одна мысль - одно предложение.
Не используй канцеляризмы, метафоры и лишние синонимы.
Не упрощай технический смысл.


Или, по аналогии с Карпатым, покороче:

Напиши примерно на 80% в стиле УТР по ГОСТ Р 58049-2017:
ясно, коротко и однозначно, но без чрезмерно формального языка.


@cgevent

Читать полностью…

Метаверсище и ИИще

#Сеня_и_Даня_Здесь_Были

Помним за что это вам...

Для контекста.

OpenAI безжалостно уволила трех сотрудников после внутреннего расследования.

Официальная формулировка: они обращались с конфиденциальной информацией вне установленных протоколов и нарушили внутренние правила.

Но.

Все трое работали именно в Safety / Alignment и в последние недели публично рассказывали, какие ужасы может принести дальнейшее ускорение гонки ИИ.

А теперь выясняется, что часть внутренней информации они сливали внешней организации, занимающейся оценкой безопасности ИИ.

То есть люди, которые должны были следить за безопасностью внутри, решили, что безопаснее будет стучать наружу.

Без работы теперь.

А тем временем Даня: Broadcom готов предоставить Anthropic до $42 млрд финансирования под аренду вычислительной инфраструктуры. Как тебе такое, Сеня?

Одни приподистерят, не убьет ли нас AGI.

Другие возают еще $42 млрд на GPU и TPU.

@cgevent

Читать полностью…

Метаверсище и ИИще

#Нейропрожарка

Одиссей. Легенды Школы Сколково

Автор: Тимофей Ступин

@lamiserest / lamiserest_comm?si=7vkoKku9mthl4skG" rel="nofollow">https://youtube.com/@lamiserest_comm?si=7vkoKku9mthl4skG

Ролик (изначально подразумевалась целая серия) для Школы управления СКОЛКОВО. Был сделан ещё зимой (и Нолан тут не причём). Основная идея: спрятать в известной всем легенде эпизод с их обучением на управленца, точно перенести архитектуру кампуса школы
Я использовал Nano Banana pro и Kling 3.0. Некоторые элементы типографики были сделаны в GPT image, у него лучше всех получается сохранить шрифт и текстуру референса. Значительная часть кадров генерилась для последующего трекинга и наложения 3D текста поверх(всё в AE). В середине ролика была использована коллажная техника в AE, но все исходники - NB + Kling. Неделя на генерацию, неделя на сборку. Бюджет: может быть, 4.000 р. с учетом большого количества вырезанных сцен (40 секунд хрона).

@cgevent

Читать полностью…

Метаверсище и ИИще

Вот думаю заказать себе такую клавиатуру, потому что использую правый Alt для надиктовки с помощью ChatGPT в любом месте Windows и Enter вместо Yes.

Думаю, что ноутбуки окончательно выродятся в планшеты. Зачем им клавиатура для вайб нормисов?

@cgevent

Читать полностью…

Метаверсище и ИИще

AMD покупает World Labs за $8.2 млрд.

Вопрос: зачем производителю чипов платить такие деньги за компанию, которая делает 3D-миры и world models?

Накидаю гипотез для чего это безумие.

1. Получить собственную frontier AI-лабораторию.

Чтобы не читать чужие papers и через год судорожно оптимизировать под них ROCm.

2. Проектировать GPU под будущие модели, а не под транформеры.

Новая архитектура модели -> новые требования к памяти и вычислениям -> новое железо.

3. Зайти в world models раньше, чем туда окончательно зайдёт весь рынок.

3D, видео, симуляция, физические пространства - всё это потенциально следующий гигантский пожиратор GPU.

4. Пролезть в робототехнику.

Synthetic data, simulation, обучение агентов и роботов - ещё один рынок, где NVIDIA уже давно расставила капканы.

5. Собрать свой ответ на Omniverse + Isaac.

Омниверс как-то не залетел в графику, но залетел в робатов. Еще одна причина по которой Флюкс и Рунвей переобуваются и держат хвост по ветру.

6. Перестать продавать просто ускорители.

AMD собирает полный стек:

модели -> software -> GPU -> racks -> data center.

То есть хочет продавать не железку, а всю инфраструктуру вокруг неё. Ох поздно!

7. Получить Фэй-Фэй Ли и её команду.

Вместе с World Labs AMD получает не только технологии, но и research-команду, способную влиять на то, какие workloads вообще появятся завтра.

Последнее, пожалуй, самое очевидное. В остальном я просто не понимаю, чем они заменят Cuda.

@cgevent

Читать полностью…

Метаверсище и ИИще

Heygen Video

Ну Минимакс и Минимакс, только без весов.

@cgevent

Читать полностью…

Метаверсище и ИИще

Хейген жбакнули **HeyGen Video** - собственную(?) видеомодель

Кажется, у нас новая стадия рынка AI-видео.

Раньше сервисы в основном делали просто: собирали у себя Kling, Veo, Seedance, MiniMax и ещё десяток моделей, прикручивали красивый интерфейс и называли это платформой.

Теперь, после выхода open weights MiniMax H3, началась следующая фаза:

берём чужую открытую foundation-модель -> дотренировываем -> подкручиваем под свою специализацию -> объявляем собственной моделью.

HeyGen прямо пишет: модель built on MiniMax H3 и отдельно post-trained в застенках HeyGen.

HeyGen как бы доучила модель под свои задачи: consistency, следование prompt, работу с продуктами и референсами, синхронный звук и более предсказуемый коммерческий видеопродакшен.

HeyGen Video умеет:

- text-to-video
- image-to-video
- reference-to-video
- сразу генерировать видео со звуком
- принимать до 9 картинок, 3 видео и 3 аудиофайлов как референсы
- обращаться к ним прямо внутри prompt
- работать в форматах от 21:9 до 9:16
- выдавать 480p и 768p
- делать ролики длиной 5-15 секунд

Главный акцент - не на слопе, а на контроле и стабильности.

И теперь самое развесёлое - цена.

До конца октября:

- 480p T2V/I2V - $0.01/с
- 768p - $0.015/с
- Ref2V 768p - $0.03/с

То есть 10 секунд 768p стоят $0.15. Чо?

Но.

После промо будет $0.30.

Для сравнения - в АПИ MiniMax Н3 сейчас отдают примерно по $0.08/с в 768p.

То есть HeyGen взяла H3, дотренировала её и продаёт производную модель заметно дешевле оригинального API MiniMax.

Ну в общем мне нравицца..

HeyGen ещё и заявляет, что на собственном blind eval их версия обошла Seedance 2.0, H3 Max и Kling 3.0. И И мы такие да, конешно!

Но сам тренд уже интереснее конкретного рейтинга.

Open weights наконец начинают работать примерно так, как и должны были: не только "скачал и запустил", а взял основу и сделал из неё собственный продукт.

Ждем Хейгена на Civitai со своим чекпойнтом...

Где щупать: HeyGen API, OpenRouter, Runware и ComfyUI(апи нодес). В собственном веб-интерфейсе HeyGen модель пока только coming soon.

Ссылки:

https://help.heygen.com/en/articles/17272995-introducing-heygen-video-generate-cinematic-clips-from-a-prompt

https://developers.heygen.com/heygen-video-1.0-catalog

https://developers.heygen.com/docs/models/heygen-video

@cgevent

Читать полностью…
Subscribe to a channel