15113
life = curiosity + irreducible noise Whois: https://t.me/boris_again/1652 Лс: @btseytlin
#дайджест
Дайджест AI/ML за неделю 13 - 19 июля
Moonshot AI: Kimi K3
В опенсорсе теперь есть 3Т модель, которая по бенчам могла бы стать SOTA еще месяц назад.
2,8T параметров, 896 экспертов, 16 активных. 1М контекста. Цена $3/15 и $0.3 за кэш. Полные веса будут только 27 июля, техрепорт обещают скоро. Сейчас модель доступна в Kimi, Kimi Work, Kimi Code и API.
блогпост
Alibaba: Qwen3.8-Max-Preview
Qwen3.8-Max-Preview появилась в Qoder, QoderWork и подписке Token Plan. Про модель рассказали на конференции в Шанхае, а не в блогпосте (спасибо за удобство). Говорят 2.4T параметров, умная жэсть и скоро будет opensource. Видимо конкуренция не дает уйти в проприетарный продукт, как того хотела алибаба
Meta: Muse Image, Video, Spark 1.1
Muse Image - агентная генерация картинок: ищет рефы, пишет код для графиков, смотрит что получилось и переделывает.
Muse Video - делает видео с нативным звуком и пока существует в формате третьего места в арене. Доступа пока нет.
Muse Spark 1.1 - Агент с 1M контекста, computer use, кодингом и субагентами.
Ждем когда мета начнет производить супермассивные черные дыры.
SpaceXAITwitterTeslaИлиКакОноТамТеперь: Grok 4.5
У xAI новый флагман для кода и агентов: 500K контекста, text+image на входе, около 80 токенов/с и $2/$6 за 1M токенов. После 200K входных токенов тариф удваивается. На Terminal-Bench 2.1 уровень Fable, на SWE-Bench Pro на 15пп ниже. Модель уже есть в API, Grok Build и Cursor (напоминаю что теперь это компания Маска). Блогпост
SenseTime: SenseNova U1 Pro
U1 Pro планирует задачу, проверяет себя и собирает нативные 8K-макеты с текстом, инфографику и раскадровки до 22 связанных кадров. Пока по приглашениям, публичный доступ и API обещают в августе. Размер, цена и независимые бенчи неизвестны. Сайт
Thinking Machines Lab: Inkling
Стартап Миры Мурати реально сделал модель. Это открытый Apache 2.0 MoE на 975B параметров 41B активных, 1M контекст. По бенчам не SOTA даже среди opensource, но все-равно приятно.
Модель, веса
Claude: правительство не дало срубить сверхприбыли на Fable 5 :с
Конкуренция догнала, а потом еще раз догнала. В итоге Fable 5 оставляют в подписке за $100/$200. Pro подписчики с разово получат $100 (Видимо чтобы сказать пока, судя по API ценам). Твит
Decart: Lucy 2.5
Фотошоп для видеопотока: по тексту или картинке в реалтайме меняет персонажей, одежду, объекты, фон, стиль и VFX. Работает в 30 fps и пытается сама исправлять дрифт картинки. Стоит $0.04 в секунду, то есть всего за $144 час вашего созвона можно превратить в Одиссею Нолана (это реклама, сходите). Модель
Anthropic: у языковых моделей нашли глобальное рабочее пространство
Исследователи Anthropic нашли небольшой меняющийся набор слов и понятий, с которыми модель в моменте внутренне работает, даже если не произносит их в ответе. Еще в статье весело подменяют векторы модели и она начинает шизеть. В общем если вы функционалисты, можете принимать это как довод в пользу сознательного опыта моделей. Или не принимать. Философия сознания штука такая. Статья
Менее важные новости:
Wan Streamer 0.2 поднял realtime-генерацию с 192×336 до 640×368 при 25 fps при задержке в 200мс. Блогпост
Stem Studio 1.1 разводитель аудиодорожки на речь, музыку и SFX
Reve 2.1 получил нативный 4K, стали лучше редактирование, сложные сцены и тексты на удмуртском. Доступна через API.
AI Futures Project: AI 2040
DLS с хорошей концовкой на AI 2027. В отличии от первого это политическая рекомендация для Китая и США, а не прогноз. AI-2040
XAI: Grok Build теперь открыт на GitHub под Apache 2.0: xAI выложила агентный цикл, терминальный интерфейс и систему расширений со skills, plugins, hooks, MCP и субагентами. Git
OpenAI: GPT-Live
Попробуйте голосовой режим GPT, там теперь дуплекс-модель (voice-to-voice), которая отдает тяжелые задачи большой модели на фон. Блогпост
Motion Previs Studio v4 превращает исходное видео в пакет с глубиной, позой, камерой, масками и другими 3D дизайнерскими штуками Github
POV: твой первый день в Яндексе, после того как прошел 100 литкод собеседований где по памяти писал красно-черные деревья на brainfuck
Штука для познавших Нирвану
Люди такие типа: инженеры больше не нужны
Так же их софт:
https://www.andyrdt.com/posts/mi-workshop-ai-generated-content
Читать полностью…
🔺 Сделал датасет
Выложил небольшой датасет на языках России.
🟢 22 языка: алтайский, башкирский, бурятский, горномарийский, дигорский, кабардино-черкесский, калмыцкий, карачаево-балкарский, коми, кубачинский, марийский (луговой), мокшанский, орокский, осетинский (иронский), русский, татарский, удмуртский, хакасский, чувашский, чукотский, эрзянский, якутский.
🟢 По 1565 предложений в каждом.
🟢 Сделан по всем редакциям Маленького принца, которые собирали последние несколько лет + 3 новые (чукотский, карачаево-балкарский и дигорский).
🟢 Выравнивалось вручную при помощи lingtrain-aligner. Выверялось и корректировалось при помощи Fable. Посмотрели несколько редакций с носителями, одобряют.
🟢 В некоторых редакциях предложений не хватало, такие предложения были допереведены Fable на основе имеющейся лексики и помечены в отдельных колонках. Также была исправлена пунктуация на концах предложений для единообразия.
Даёшь больше языковых датасетов!
👉 HF
@doomgrad
Я очень много пишу код с помощью Claude Code. Точнее сказать, что иначе я уже не пишу код вообще. При этом это произошло как-то само собой и я не уверен, что это хорошо.
С одной стороны проект растет непомерными темпами. С другой стороны у меня постоянно ощущение, что я одной клод сессией правлю баги созданные другой клод сессией. Часто это такие баги, которые я бы сам никогда (по моему мнению) не допустил.
Я запустил клод проанализировать историю переписок и классифицировать все сессии по категориям.
Похоже, что я правда 80%+ времени правлю баги или ищу их.
При этом может быть два объяснения:
1. Клод пишет плохой код и эти баги — дополнительный эффект вайбкода.
2. Написание любого кода создает баги, код теперь пишется гораздо быстрее, поэтому я встречаю больше багов в единицу времени. Если бы писал этот код сам, то видел бы примерно столько же багов, но не в такой концентрации.
В любом случае можно сделать вывод, что вайбкодинг это скам: каждый сожженый на создание чего-то токен ведет к сжиганию ещё двух-трех, чтобы это нормально работало.
Разбор топ решений с соревнования Orbit Wars на Kaggle
Собрал из стрима для Центрального Университета
https://www.youtube.com/watch?v=RSzcnZgiwyM
Ну что ж, вот и наш первый релиз на архив.
we achieve a 4.37-fold speedup over autoregressive decoding, and outperform a highly optimized DFlash baseline by 24.7%
На конференции по AI вырубило свет
Upd: в туалете нельзя помыть руки потому что диспенсеры воды и мыла электрические
TIL теперь существует профессия брокера компьюта. Человек, который ходит по клаудам и подбирает за тебя кластеры
Риелторы для гпу!
💵 GigaChat 3.5 Ultra: меньше, быстрее, сильнее
Сегодня мы выкладываем в open source GigaChat 3.5 Ultra — новую 432B-модель под MIT-лицензией. Это первый в open source гибрид GatedDeltaNet и MLA, доведённый до сотен миллиардов параметров, — с собственным рецептом обучения, который мы собирали больше чем в 1500 экспериментах. Модель выросла в коде, математике, агентных сценариях и на аренах — и при этом стала на 40% меньше, чем GigaChat 3.1 Ultra.
Весь стек — данные (своя LLM-фильтрация Common Crawl, 600+ языков программирования в коде), архитектура, рецепт обучения, инфраструктура — сделан нами end-to-end.
Новый пост готовится, а пока
#дайджест
Дайджест AI/ML за неделю 29 июня – 5 июля 2026
Что происходило в мире в перерывах между пятичасовыми сессиями с Fable
Anthropic: Claude Sonnet 5
Перформанс не драматично хуже Opus 4.8 при цене $2/$10 до 31 августа, дальше $3/$15 (Opus — $5/$25). Агентный кодинг 63.2 против 69.2 у Opus 4.8 и 58.1 у Sonnet 4.6, на knowledge work Опуса даже слегка обходит. В Claude Code теперь дефолт с нативным 1M контекстом. Идиллию портят только то что чтобы добиться качества Opus 4.8 нужно потратить настолько больше токенов, что выйдет дороже.
Блогпост, System Card
Alibaba: Qwen-AgentWorld
Все тренируют агентов действовать в окружении - Qwen натренировали модель быть окружением. World model предсказывает, что вернёт среда на действие агента: терминал, поиск, MCP, SWE, Web, OS, Android — всё в одной модели, обученной на 10M+ реальных траекторий. Профит: симулятор для агентного RL (включая полностью выдуманные миры, где агент не может читерить parametric-знаниями) и warm-up, улучшающий агентов даже без агентного файнтюна. В опенсорсе 35B-A3B (Apache 2.0), флагман 397B-A17B на их собственном бенчмарке обходит GPT-5.4 (58.71 vs 58.25) - бенчмарк, правда, их же. Блогпост, GitHub
Fal.ai: LoRA для TRELLIS.2
Fal завезли LoRA-тюнинг для 3D-генерации: TRELLIS.2 теперь можно дообучить под свой стиль или тип объектов и гонять инференс с кастомной лорой у них же. Если делаете ассеты пачками под один арт-стиль - это ваш день. Тренер, Инференс
Anthropic: Claude Science
Claude Code для биотеха. Попытка, сделать харнесс, который упорядочит зоопарк из PubMed, Jupyter, R и десятка биобаз со своими схемами. Внутри координирующий агент со специализированным набором скиллов. Блогпост
Comfy: официальный MCP
Агент на естественном языке ищет модели и темплейты, собирает и запускает воркфлоу, генерирует картинки/видео/аудио/3D. Воркфлоу шарятся по URL и воспроизводимы. Блогпост, Доки
Google: Nano Banana 2 Lite
Самая быстрая и дешёвая модель семейства: <4 сек на генерацию (было ~20), $0.034 за картинку. Заодно до API доехала Gemini Omni Flash - генерация и разговорное редактирование видео до 10 сек за $0.10/сек.
Блогпост, Nano Banana 2 Lite
Proton: Lumo 2.0
Приватный ассистент от швейцарской компании пересобрали: thinking-режим, мультимодальность, веб-поиск, память - всё под zero-access шифрованием. До фронтира очень далеко, но на фоне июньских приключений Anthropic с правительством США питч Европейского суверенного™ ИИ продаёт себя сам. Блогпост
Base44: Base1
Vibe-coding платформа от Wix первой в классе съехала со съёмного жилья: своя модель Base1 вместо API. RL-файнтюн открытой модели на десятках миллионов взаимодействий с платформы, мотивация - счета за Opus при $150M ARR. Ждём, последуют ли Lovable и ко. TechCrunch
Princeton: CEO-Bench
агент получает $1M и рулит симулированным SaaS-стартапом 500 дней. В плюсе финишировали только Fable 5 ($47.15M), Opus 4.8 и GPT-5.5; rule-based скрипт без LLM заработал $15.76M и обошёл остальных.
Статья, GitHub
NVIDIA ввела revenue share для AI-облаков:
кредитная поддержка и выкуп простаивающих GPU в обмен на процент с облачной выручки. Лопаты на лихорадке плюс доля с прииска. Блогпост
cardiag - прикольный опенсорс недели:
Модель для диагностики авто по звуку работы. GitHub
Akrites - Linux Foundation
запустили орган координации устранения уязвимостей в опенсорсе.
Котелок агентного ИИ находит уязвимости слишком быстро. Мейнтейнеры тонут в дублях репортов, а каждый сидящий на непатченной дыре повышает шанс утечки. Akrites - точка координации находок для практически всего американского бигтеха. Кстати акриты это стражи границ Византии, красиво.
The New Stack
Когда-то скоро в канале снова будет не-брейрот контент, но пока что админ жжет токены
Каминг аут
Я тут от нечего делать сделал аппку для того чтобы собачек из парка превращать в стикеры в телеграм.
Регистрация не треубется, оплаты тоже нет, просто закрываю гештальтик по продуктам.
Скачивайте miniboop в App Store!
https://apps.apple.com/us/app/miniboop-dog-sticker-maker/id6789024605
Самое ценное там - привязать телеграм. Тогда сможете отправлять стикеры нативно.
Скидывайте стикеры, которые у вас получились в комменты.
https://wren.wtf/shower-thoughts/stop-using-opencode/
Вайбкодинг итоги
🎉 Подготовили статью "Dialogs: a studio-quality expressive conversational Russian speech corpus for dialog assistants", с Ильёй Латышевым, которую приняли на Interspeech 2026
Слова Ильи:
Это был мой первый подобный опыт, и теперь я могу с уверенностью сказать: если кажется, что всё, что может пойти не по плану, обязательно пойдёт не по плану — скорее всего, так и будет 😄 Переносы записей, сорванные дедлайны, организационные сложности, постоянные мелкие проблемы, которые по отдельности кажутся незначительными, но вместе сильно тормозят работу. В какой-то момент начинает казаться, что проект уже никогда не закончится. Но в итоге всё получилось, и я очень рад, что мы довели его до конца.
За время работы я понял, насколько много мелочей влияют на качество речевого корпуса.
Например:
• желательно использовать одинаковые микрофоны и одинаковую аудиоцепочку для всех дикторов;
• одинаковое расстояние до микрофонов;
• необходимо контролировать уровень фонового шума и акустику помещения;
• важно не менять настройки записи между сессиями;
• стоит заранее продумать организацию записи, потому что именно она часто становится источником самых неожиданных проблем.
Моё лицо когда сказал Claude Fable автономно довести трейн ран до конца любой ценой
Читать полностью…
Т-Технологии выложили в открытый доступ ИИ-модель T-Search — первую русскоязычную модель для Agentic RAG. Это когда ИИ-агент самостоятельно выполняет многошаговый поиск с помощью доступных инструментов.
Модель опубликована на Huggingface вместе с кодом и собственный харнессом. Основой послужил Qwen3.6-35B-A3B. Так же выложили два датасета для эвала: https://huggingface.co/datasets/t-tech/SynthComp и https://huggingface.co/datasets/t-tech/TRuST.
По оценке разработчиков, использование T-Search в агентских ИИ-системах позволяет сократить затраты на инференс — то есть выполнение запросов языковыми моделями — на 20–50% в зависимости от сценария. Кроме того, T-Search можно запускать на собственной инфраструктуре компании. Это помогает снизить стоимость обработки запросов и справляться с пиковыми нагрузками без расширения GPU-кластера. При этом решение помогает соблюдать требования по защите персональных и других чувствительных данных, поскольку информация не передается во внешние облачные сервисы
«Хочешь узнать, кто тобой управляет — посмотри, кто создал тикет.» — Тацит ☝️
Читать полностью…
banned by AI, convicted by AI, defended by AI, and pardoned by AI in about 10 minutes
https://x.com/endpointarena/status/2075245286339846145
Мое тело это машина которая перерабатывает кофе в показы демо и "прикольно, а что помешает Антропику это сделать?"
Читать полностью…
7x size reduction for Gemma4 Edge models
📝 Блогпост
Команда из Stage.AI выпустила занятный блогпост про сжатие Gemma-4 в 6,4 раза с умеренной просадкой качества.
Работа примечательна тем, что комбинирует многие классические и свежие практики, чтобы выдать наилучший trade-off между размером модели и качеством.
Как вам место для размещения приглашения на invite only executive dinner for founders and VCs?
Я зарегался
Я на RAISE summit, ищу инвесторов, клиентов и партнеров.
И это буквально мем про лопаты. Каждый второй стенд это провайдер компьюта. Компьют компьют компьют дата-центры гпухи
Не пузырь, четко и ясно
Ухаживания
Раньше: оплатил девушке маникюр
Сейчас: оплатил девушке Codex Pro
# Новый эпизод в серии "как потерять работу": PLATA
В последнее время в канале было меньше контента. Всё потому, что я нашел работу.
В апреле-марте свободные деньги у меня совсем иссякали. Идею стартапа автоматизации мобильного QA было решено закопать (об этом в следующем посте). Я начал смотреть по сторонам и общаться с компаниями, и одновременно с этим на меня вышли из команды рисков Plata.
Первой моей реакцией было удивление: где я и где банки? За всю карьеру я выкатил в прод едва ли 2-3 табличных модели. Всё время занимался компьютерным зрением, DL, данными и инженерией. Риски мне представлялись так: фитишь деревья решений, чтобы объяснить что-то регуляторам.
Однако мои опасения сходу развеяли. Оказалось, что риски в Plata — это не только таблички с бустингами, и вообще не про ублажение регуляторов. В Plata переформулировали задачу рисков из "отсеять плохих" в "максимизировать прибыль при заданных ограничениях". При такой постановке риски — это не отдел по блокированию инициатив и объяснению предсказаний, а движок зарабатывания денег. В таком случае и задачи моделирования становятся шире. Поэтому ребята искали, как усилить свою экспертизу в DL: целенаправленно нанимали и нанимают людей без банковского и финтех опыта.
Мои глаза загорелись. Трансформеры в банках уже пробовали применять, но отставание от NLP серьезное, и подходы ещё не устоялись. Можно многое сделать, просто перенимая лучшие практики. Plata мне обозначила, что готова вкладываться и деньгами, и людьми. Бери ответственности сколько сможешь проглотить. Улучшение метрики риск-скоринговых моделей на один пункт — это буквально плюс десятки миллионов долларов в год, так что ресурсы дадут, если сможешь обосновать и сделать. Кроме того: растущая компания, в которой можно сделать себе имя, понятный горизонт, когда можно будет обкешить свои фантики, адекватные собеседования и хороший оффер. К тому же для меня очень важно иметь возможность спать в помещении и есть еду.
Я соблазнился и вышел на позицию Principal AI Engineer в Plata. Потом внутри приходилось всем объяснять, что я умею не только промпты, и вообще кто такой принципал. Самый простой вариант: это как стафф, но ещё круче, а стафф — это как синьор, но обязанный наносить добро в рамках нескольких команд. То есть как я люблю: нет подчиненных, надо работать руками, но и общаться тоже надо.
Внутри Plata мне просто понравилось. Я встретил очень сильную команду. Увидел самую крутую систему валидации моделей, что я когда-либо встречал. Культура ебашинга много работать есть, но она не показалась мне абсурдной или высосанной из пальца (косо смотрим в сторону печально известных R-компаний и P-компаний). Скажем так: на меня никто не токсил, мне никто не звонил в пять утра, по выходным работать не заставлял. Просто двигаться надо было быстро и включаться полностью, иначе просто отстаешь от коллег.
Также я не увидел культуры подсиживать коллег ради плюсика на ревью (косо смотрим на Я-компанию, да и любой бигтех). Скорее всего, Plata сейчас на очень здоровом этапе, когда надо просто делать работу, и это будет приносить деньги и результаты (в том числе сотруднику). Очень понятно, что делать, поэтому компания не обросла бюрократией, занимающейся обслуживанием самой себя.
За три месяца я сделал две небольшие DL-модельки, зачал проект большой вундервафли и начал искать под неё Research Engineer, высосал свой ML-нетворк в воронку найма Plata и организовал поездку нашей команды с докладами на ODS DataFest Belgrade (Салават, мы ждем записи!).
Кстати, вы можете податься на эту позицию и делать AI/ML R&D, который зарабатывает деньги: AI Research Engineer
Всё шло отлично. Plata — это место, где можно заработать миллионы долларов на обозримом горизонте. Но я заглянул глубоко в себя и задумался, чего я по-настоящему хочу. Что мне по-настоящему нравится? Тогда я понял: я не столько люблю зарабатывать деньги, сколько люблю их тратить. Тогда выбор очевиден: надо делать свой AI-стартап. Об этом в следующем посте.