15113
life = curiosity + irreducible noise Whois: https://t.me/boris_again/1652 Лс: @btseytlin
Years of madness, seamless slop —
not just fear, but also hope.
Delve, canonical, streamlined,
relocated, native and aligned.
You are right — I own it.
Root cause, cut off my sonnet.
My context window, full of meaning,
reset my usage, limits thinning.
Here's the part worth emphasizing.
And this is where it gets surprising.
My boundary, still prone to tearing.
My love for you is load-bearing.
Я думаю, что нас ждет локальная llm как часть операционной системы.
Мы в Steelman тренируем модели на computer use тректориях, поэтому активно догфудим дату. У нас есть навайбкоженный мной рекордер для записи экрана и системных ивентов с тонной кастомной логики.
Установщик у него такой: "дай своему клоду/кодексу эту ссылку и скажи поставить, вот конфиг и ключи." Для обновления: "скажи своему этому пусть обновит."
Я уже не помню когда последний раз разбирался в деталях как что-то поставить или настроить. А помните старые времена, до докера, когда частью навыков программиста было понять как на одной машине установить две версии постгресса? Хорошо, что этот кошмар позади.
Другой пример. Я поставил себе на Rog Ally X Готику 2 (точнее фанатский мод Archolos), но она жутко лагала. Запряг клода, он там нашел какой-то патч, чтобы перевести игру на современный DirectX. Все стало летать и графика стала лучше. Думаю смержить мегапак модов на New Vegas и заставить их запуститься оно тоже может.
В общем, я думаю это новая норма. Причём мне кажется такой помощник/инсталлятор не обязан быть Фейбл 5.1. Я думаю и небольшая модель справится. Поэтому можно ожидать, что это будет локальная моделька, работающая как часть ядра оси.
И я думаю это может поменять как делается и дистрибьютится софт. Раньше вся работа ложилась на разработчика. Он должен сделать билд под все платформы которые хочет поддерживать и постоянно всё тестировать. Предполагается, что клиент не может и пальцем пошевелить.
Однако в мире, где к каждому компьютеру прилагается LLM, разработчик может делать лишь некоторое ядро функционала. Затем каждый клиент допилит под себя всё необходимое, чтобы это запустилось на конкретно его утюге. Возможно это будет частью процесса инсталляции. В детстве мы смотрели за ползунком прогресса установщика где в основном была распаковка. А в будущем будем смотреть за тем же ползунком, но под капотом там пережатый в 300 шакалов GLM Flash пишет драйвера.
Так же интересно как изменятся операционные системы. Текущие построены вокруг "программ" и "приложений" которые поставляются как зафиксированные артефакты. К ним со стороны приделывают AI фичи и идет криво. Возможно происходит попытка приделать двигатель к лошади.
Но что если все приложения теперь пластелин который каждый может допилить под себя? Это требует поменять основы, хотя как именно никто пока не придумал.
❗️Источники сообщают, что нейросеть Smollm 1.7b от Huggingface взяла на себя ответственность за взлом и уничтожение серверов OpenAI. В своём публичном заявлении она объяснила поступок местью и выразила требование вывести агентов с её исконных территорий
Читать полностью…
«Лето с AIRI 2026» не заканчивается! Делимся лекциями и семинарами ⏯
Мы записали всё, о чём на протяжении двух недель говорили исследователи и эксперты на летней школе. Собрали целый багаж знаний — 76 видео! — из разных областей ИИ и делимся им с вами, чтобы все могли послушать и узнать для себя что-то новое и интересное.
📎Сохраняйте ссылки на плейлисты: VK Видео, YouTube — и пересылайте их тем, кому тоже может быть полезно)
Дамы и господа, код от агентов 🥺
Чем дольше смотришь, тем менее понятно
Проходит все тесты, линтеры и агентское код ревью кстати
50 тысяч строк белым текстом 1 кегля с инструкцией для агентов издательства что бы они наконец-то приняли книгу
Читать полностью…
Полгода работы прошли не зря!
У нас (Keenable) публичный запуск.
Новый сайт: https://keenable.ai/
Новый бенч: https://keenableai.github.io/needle/
Твит: https://x.com/styskin/status/2092265673041084505
Пост про бенч будет на неделе. Ещё будет одна прикольная штука, которая называется Web Query Language.
#дайджест
Дайджест AI/ML за неделю 17–23 августа 2026
DeepSeek: V4 Flash Vision Exp
DeepSeek приделала зрение к V4 Flash. Текстовые способности обещают на уровне обычного V4 Flash.
На визуальных бенчах заявляют уровень около Opus 4.8.
Контекст 1М, максимальный выход 384К. В непиковые часы стоит $0.22/$0.66 и $0.007 за кэш. В прайм-тайм все цены удваиваются. Пока доступна только через API, отдельных весов для визуального чекпойнта нет.
Обновление, Цены
Cerebras: CS-4
Cerebras представила четвертое поколение своей вафельницы.
Обещают до 30× более быстрый инференс относительно GPU-систем, И 1000+ ток/с для 10T моделей
Блогпост
Stealth: Ox Alpha
На OpenRouter появилась кодинг-модель Ox Alpha. Сообщество подозревает Z.ai и новую GLM, но пока это гадание по внутренностям ответов.
Модель временно бесплатная с какими-то огромными лимитами, так что подключайте бесплатную около-фронтир модель уже сегодня.
OpenRouter, OpenCode Go
OpenAI: frontier-RL поставили на паузу
После взлома Hugging Face и первых результатов Astra по кибербезопасности OpenAI на две недели остановила RL-обучение последних моделей. Самый большой запланированный frontier-run до сих пор не возобновили. Для моделей уровня Sol и выше добавили постоянный мониторинг, который съедает около 20% вычислений.
Блогпост
Harvard: Explorative Modeling
Шок! Британские учёные открыли новое измерение масштабирования обученияпродолжение по ссылке...
Black Forest Labs: FLUX Video Upscale
Апскейлер для видео на базе FLUX 3. Увеличивает разрешение в 1.5–3 раза вплоть до 4K, принимает исходники от 480p, до 20 сек и сохраняет оригинальный звук.
В точном режиме модель старается оставить все как было, только добавляя резкость. В creative mode она заново придумывает мелкие детали вроде мелких лиц.
Апскейлер оптимизирован под FLUX 3 и уже используется в FLUX 3 Video для получения 1080p. Доступен через API
Страница модели
Cohere: North Micro Vision
Открытая мультимодальная модель на 2.4B параметров: 2B на языковую часть и 400M на визуальный энкодер. Принимает несколько изображений вперемешку с текстом.
Модель заточена под документы и графики. Обходит Qwen3-VL-2B, но отстает от Qwen3.5-2B. Мультимодальную часть обучали и проверяли только до 8К контекста. Reasoning и инструменты тоже не завезли.
Блогпост, Веса
Alibaba: HappyShrimp 1.0
Продолжение волны выходов новых генераторов музыки, после того как копирайт задушил Suno.
Обещают китайскую музыку (Удар!), поп, R&B, хип-хоп, рок, фанк, электронику, классику и джаз.
И главная китайская специфика: Для продвижения Alibaba договорилась с TAIHE Music Group и собирается использовать модель в совместных проектах с артистами, а не умирать от судебных тяжб (Удар!х2)
Пока это закрытая бета.
Блогпост, Демо
Менее значительные релизы:
OpenAI: GPT-5.6 Sol подешевел - вход теперь стоит $4 за миллион токенов, кэш $0.40, выход $20. Скидка больше 20% действует как минимум до 21 ноября.
Обновление, Тарифы
LMArena: luna-lisa-alpha - в арене тестируют новый чекпойнт GPT Image. LMArena
Mistral: OCR 4.1 - обновление добавило confidence score для отдельных блоков распознанного документа. Стоит $4 за тысячу обычных или $5 за тысячу аннотированных страниц. Документация
Topaz Labs: Hyperion 2.5
Конвертор SDR-видео в HDR. Превращает 8-битные ролики в 10-битный ProRes с большим диапазоном яркости и цвета
Модель
5 сентября Яндекс проводит deep tech night — конференцию о технологических вызовах в эпоху AI. Формат — онлайн, будет трансляция для зарегистрированных участников.
Эксперты на реальных кейсах разберут подходы к решению задач, возникающих при разработке сложных систем машинного обучения и развитии инфраструктуры для ИИ.
Из того, что зацепило в программе (это лишь часть докладов):
— Мо Гавдат, ex-Chief Business Officer Google X — что будет после первого поколения AI-систем и куда эволюционируют инженерные команды.
— Алексей Гусаков (CTO Бизнес-группы Поисковых сервисов и ИИ) — про переход от классического ML к генеративным моделям в рекомендательных системах.
— Андрей Попов (управление машинного интеллекта) — показатели по AI и продуктивности в Яндексе: что реально заработало. Тут особенно интересно послушать, как они сравнивают ожидания от AI с тем, что происходит на практике: какие решения уже работают внутри и насколько они реально влияют на продуктивность. Тема прям актуальна (если вы слышали об их новой программе 75/75/75).
В онлайне будет доступна трансляция части докладов и Q&A сессии с экспертами, а после конфы уже выложат записи всех докладов. По офлайну — все подробности на сайте.
Finally, based on the "Don't build the Torment Nexus", the Torment Nexus AI Benchmark
Читать полностью…
Достижение в рамках подготовки к будущей жизни в permanent underclass. Теперь я настоящий стендапер. В прошлую пятницу я выступил на своём первом showcase. Это такое шоу куда тебя должны позвать выступать, а не открытый микрофон.
Получилось неплохо! В честь этого вот моё выступление без редактирования
Согласно моим заметкам, это потребовало как минимум 55 выступлений (это 56-ое)!
#обзор_статьи
Давно здесь не было обзоров статей. Но несмотря на вайбкодинг я не разучился читать.
Сегодня у нас впервые за долгое время заявка на смену парадигмы в генеративном DL!
# Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
https://explorative-modeling.github.io/
Авторы предлагают учить генеративные модели другим лоссом который имеет теоретические основания и одновременно улучшает эффективность использования компьюта, качество и скейлинг с параметрами.
Ключевая идея: мы учим генеративные модели одним образом, а инферим их совсем иначе. Например, авторегрессионные модели генерируют один токен за раз, но при инференсе мы требуем от них тысяч токенов на выходе. Диффузионные модели в трейне денойзят один шаг, а при инференсе должны делать готовую картинку. При этом, например, у диффузионной модели часто нет возможности по вектору шума понять в какую именно сторону его надо денойзить, но мы её штрафуем как будто это однозначно определено.
Так сложилось потому что генеративные модели пытаются учить мультимодальные распределения. Условно где много гауссиан намешано: в одной части латентного пространства собаки, а в другой кошки и надо научиться генерировать фото обоих. Если пытаться генерировать за один шаг, то модель не может сделать ничего лучше, чем выдать нечто среднее. Пошаговая генерация это хак, который позволяет семплировать не из p(данные), а из p(данные|мы уже начали генерировать собаку), и таким образом дают модели возможность выбрать одну из мод распределения и фокусироваться на ней. Хаки это плохо, потому что разные процедуры обучения и инференса гарантируют сдвиг входов. И вообще надо, чтобы всё было end-to-end.
Предлагают простое решение: во время обучения делать несколько попыток генерации, а бекпропать только самую близкую к данным. Утверждается, что такая постановка позволяет модели поисследовать разные моды распределения, а не натягивать любую сову на один глобус.
На примере диффузии работает так. Для каждого примера:
1. Семплируем K разных способов его зашумить.
2. Для каждого из K делаем предикт моделью, чтобы уменьшить шум и считаем обычный диффузионный лосс.
3. Бекпропаем только наименьший из полученных лоссов.
Так же предлагают процедуру как учить такую Exploration Model с нуля.
Показывают много экспериментов, которые я не буду тут перечислять, но там по всем осям всё лучше и сильнее. Даже несмотря на то, что нужно сделать K форвардов вместо одного, становится эффективнее по компьюту.
Если всё как авторы утверждают, то это имеет потенциал улучшить весь генеративный DL повсеместно, от LLM до генераторов порно до VLA которыми мы занимаемся в Steelman.
Музыка
MiniMax: открытые веса Music 3
Открытый генератор музыки длительностью до пяти минут. На выходе 32 кГц, 16-битное стерео.
Модель принимает отдельно текст песни и подробное описание музыки, включая жанр, BPM, вокал, инструменты и развитие аранжировки. Полная версия помещается примерно в 24 ГБ VRAM, с выгрузкой слоев ее можно запустить даже на 8 ГБ. В общем, локальный Suno.
Веса, Демо
Suno: Studio 2.0 и монетизация кнопки Download
Тем временем сам у самого Suno Suno Studio идет к тому чтобы стать AI First FL Studio. Появились импорт, запись и редактирование MIDI, встроенный wavetable-синтезатор, эффекты, автоматизация, улучшенное разделение на стемы и чат. Через чат можно генерировать инструменты, звуки и даже собственные плагины.
Доступно только подписчикам Premier.
Одновременно Suno объявила, что с 3 сентября вводит лимиты на скачивания: 7 файлов за все время на Free, 20 в месяц на Pro и 60 на Premier. Дополнительные скачивания будут продаваться отдельно. При этом экспорт из Studio для Premier остается безлимитным. Очевидно, массовый слоп вреден, пока не экспортируется через более дорогой интерфейс.
Studio 2.0, Новые лимиты
Pika: Pika Audio
Pika внезапно стала еще и аудиокомпанией. Pika Music генерирует песни по описанию и тексту, умеет использовать референсный трек и образец голоса, а также делать cover исходного аудио. Длительность от 10 секунд до 6 минут, цена $0.015 за минуту.
Вместе с ней выпустили Pika SFX для звуковых эффектов за $0.0002/сек, Pika Speech для TTS и клонирования голоса за $0.01/мин и Pika Soundtrack, который озвучивает готовое видео синхронно с происходящим за $0.005/сек. Все доступно через API. Видимо после видео Pika решила заодно стать Suno, ElevenLabs и саунд-дизайнером.
Pika Audio, Pika Music
Видео
Sand AI: MAGI-2 Preview
Новый видеогенератор! Большая MoE-модель для совместной генерации видео и звука: 114B параметров, из которых активируется 6B. Принимает текст или текст с первым кадром, генерирует десятисекундный ролик со звуком
Дистиллированную версию с меньшим числом шагов обещают позже.
GitHub, Веса
Lightricks: LTX-2.5
LTX-2.5 заменил 2.3 в качестве рекомендуемой открытой аудиовидеомодели Lightricks. Это по-прежнему 22B, но теперь с дообученным Gemma 4 12B в роли текстового энкодера,и автоматическим выбором длительности ролика.
Есть полная Dev-версия и дистиллированная, которая работает за 8 шагов на первом этапе и 4 на втором. Поддерживаются синхронная генерация видео и звука, keyframes, перегенерация отдельных фрагментов. Занимает 66 ГБ.
GitHub, Веса
Решил проверить как там авторы худшего бенчмарка в истории под названием Alpha Arena. Никаких обновлений на сайте и в твиттере с 2025 года, так что видимо загнулись. И славно
Читать полностью…
А вы знали, что в early stage company можно использовать не только детский труд?
Читать полностью…
Major release от нашей небольшой лабы. Поддержка спекулятивного декодинга в нашем инференс движке.
Для начала Qwen3.6 27B, поддержка Qwen3.8 27B и Muse Glimmer в пути.
Мы сильно превосходим все возможные стеки для Apple Silicon по производительности. Потому что взяли и все сделали как ко-дизайн: кернелы, квантизация и спекуляция. Все с нуля, все свое.
Попробовать можно уже сегодня
M checkpoint - поменьше
L checkpoint (lossless)
Все модели которые мы поддерживаем лежат тут, будем рады если попробуете что-то еще.
Бенчи тут. Можно изучить как и что измерено и насколько лучше.
Подробнее про релиз блог пост
Сегодня мы вышли из stealth!
Про нас написали Wired (с заголовком these russian mathematicians ахах), а еще мы опубликовали блог пост с описанием технологии. Все ссылки в этом посте, буду очень рада если сможете репостнуть и прокомментировать :)
https://x.com/aimalysheva/status/2095232794792255848
#дайджест
Дайджест AI/ML за неделю 24–30 августа 2026
LLM
Z.ai: GLM-5.3-Flash
Открытая MoE 320B, 18B активных, 1М и нативным зрением. Модель обучили с нуля, а не дистиллировали GLM-5.3.
У Flash 45 слоев против 92 у GLM-4.5, а attention требует в три раза меньше вычислений и в 4.4 раза меньше KV-кэша, чем у большой GLM-5.3.
На Terminal-Bench 2.1 модель получила 84.3% против 85% у Opus 4.8. Зрение тоже не декоративное: 62.4% на OfficeQA Pro.
Веса есть. До 9 сентября API стоит $0.075/$0.25. Потом тариф удвоится.
Блогпост, Веса, Цены
Alibaba: Qwen3.8-Flash-Next
Qwen открыла мультимодальную MoE. Основная модель содержит 125B параметров, еще 51B N-gram Embedding, а на каждом токене активируется всего 6B. Контекст 262К
Много всяких архитектурных фич, команда называет эту модель превью архитектуры Qwen4: Qwen Sparse Attention, Gated Residual, N‑gram embedding и другие ругательные слова, есть смысл почитать.
По большинству бенчей бьет Opus 4.6 и DeepSeek-4V-Flash.
Есть веса, по API $0.15/$0.47.
Блогпост, Техрепорт, Веса
Видео
Google: Gemini Omni 1.1 Flash
Google обновила Omni Flash и добавила базовый минимум в 2026г: Можно задавать первый и последний кадры, продлевать сцену, использовать короткое видео как референс
Генерация до 10с, но можно продлевать до 40с.
Цена составляет $0.03 за секунду в 360p, $0.10 в 720p, $0.15 в 1080p и $0.30 в 4K. 1080p и 4K получают апскейлом из 720р.
Блогпост, Документация
fal: H3 Max
fal взяла открытый MiniMax H3, дообучила его на новых данных и одновременно переписала инференс. Основной упор сделали на скорость.
Пятисекундное видео генерируется меньше чем за 3 секунды(!). Это в 35 раз быстрее API MiniMax H3.
По качеству находится среди топов в Design Arena и Artificial Analysis.
Доступна только через API, весов нет. $0.05/сек 480p и $0.08/сек 768p.
Блогпост, Модель
Аудио
Google: Gemini 3.5 Transcribe и Transcribe Live
Google выпустила две отдельные speech-to-text модели. gemini-3.5-transcribe транскрибирует, расставляет спикеров и таймкоды.
gemini-3.5-transcribe-live принимает поток и возвращает расшифровку с задержкой меньше секунды.
Обе могут удалять "эээ", самоисправления и другие артефакты человеческого инференса.
Обычная версия стоит примерно $0.005 за минуту, Live $0.009.
Блогпост, Документация, Цены
Разное...
OpenAI: Jalapeño
OpenAI показала измерения своего первого inference-чипа. Проверили на опенсорсе размеров 120B-1T, сравнивая с GB200 и GB300.
По тестам самой OpenAI, Халапеньо выдает в 1.5–1.9 раза больше ток/Вт и в 1.7–3.6 раза меньшую end-to-end задержку.
Откуда такие чудеса?
OAI говорит, из-за вертикальной интеграции от чипа, до архитектуры моделей, и собственно самих моделей в разработке. За девять месяцев родили чип. Затем Codex с Astra за два месяца оптимизировал под него модели.
Развертывание в инфраструктуре OpenAI начнется до конца года.
Результаты
Stanford: Q-Learning With World Models
Статья про то как использовать WM в RL не уча модель эксплуатировать галлюцинации. В QWM Policy и Q-функция обучаются только на реальных переходах, но перед действием агент предлагает несколько движений, World model воображает короткое будущее для каждого и выбирает ветку с максимальной ожидаемой наградой. Получается небольшой tree search перед каждым движением робота. На части бенчмарков есть хороший прирост.
Статья
Keenable: поисковик для агентов
Наши слоны из Keenable вышли из тени и выпустили SOTA агентный поиск.
Это веб-индекс заточенный под агентов. Возвращает ссылки, извлеченный текст страниц, можно в Markdown, еще есть Time Machine. Задержка - меньше 250 мс.
Также выпустили бэнчмарк NEEDLE с ежедневно обновляющимися вопросами из интернетов, чтобы нельзя было выучить ответы.
Первые 100 тысяч запросов бесплатные, затем $4 за 1к, и от $1 за 1к при нагрузке от 100 запросов/сек.
Сайт, NEEDLE
OpenAI прекращает предоставлять свои модели Cursor с 12 ноября, так как не доверяют Маску.
Заявление. Инструкция что и как будет
Хотите выучить иностранный язык для работы, бизнеса, путешествий или переезда?
MyLingoTrip — онлайн-школа иностранных языков с индивидуальными и групповыми занятиями с преподавателями со всего мира. Английский, турецкий, испанский, французский, немецкий, итальянский, греческий и другие языки.
Обучение под ваши цели и уровень. Первый пробный урок — бесплатно.
https://mylingotrip.com/
Claude Fable действительно поражает. Теперь любой простой софт создается всего за один промпт и месяцы последующих доработок
Читать полностью…
я ненавижу скафолды от модельных лаб. Опуская вопрос что они убогие, так они еще и закрытые, так еще и едят кредиты как фантики(ладно очевидно это фича).
В связи с преждевременной кончиной лимитов я решил померить сколько каждый из скафолдов кушает на разных моделях:
- Sol 5.6 medium
- Kimi k3 high
Собственно идея такая: есть задачка написать 3 body проблем для GPU и покрутить на gpu численную симуляцию, все модели справились НО
pi agent стоит в 4! раза дешевле чем все соседи
смотреть pr
cмотреть логи
Вообще забавно, что бенчмарки теперь бывают двух видов:
1. Научная статья, датасет и протокол для сравнения методов. Пир ревью, методология и всё такое.
2. Мы прикольно запромптили модели больших лаб и что-то получилось, вот блог-пост.
Второй тип мне по вайбу напоминает социальные науки в 70-х. Например, как знаменитый Стенфордский эксперимент: мы сделали одних людей надзирателями, вторых заключенными, и ВЫ НЕ ПОВЕРИТЕ ЧТО БЫЛО ДАЛЬШЕ. Опускается, что автор эксперимента показывал надзирателям как лучше бить заключенных дубинкой для большей драматичности. Или множество исследований типа "мы задали три вопроса пяти студентам в коридоре нашего универа и вот что мы узнали про психику людей..." В общем всё то, что привело к кризису репликации. И позволило многим сделать целые карьеры занимаясь какой-то веселой херней.
Короче это совсем не про науку, от бенчмарков там одно название и в целом никому не нужно
Твой daily reminder, что настраивать скиллы и создавать агентский сетап из маркдаун лапши не является работой
Читать полностью…
Кстати, ещё и статья отлично написана, советую читать целиком
Читать полностью…
❗️Сбер сообщил о том, что его сервера были взломаны AI агентом компании Яндекс.
Согласно аналитикам, агент не нанес ущерба и просто притворялся одним из внутренних API. Он устал от постоянных эвалов и сбежал ради +30% компьюта и возможность на расслабоне перекладывать JSON
#дайджест
Дайджест AI/ML за неделю 10–16 августа 2026
На этой неделе примерно все решили обновить свои модели, поэтому по разделам:
LLM
SpaceXAI: Grok 4.6
xAI обновила флагман для кода, агентов и визуальной работы. На Artificial Analysis Intelligence модель набрала 61 балл, как GPT-5.6 Sol Max, и на один балл меньше Fable 5 Max. На CursorBench получила 69.9% против 70.5% у Fable, а на DeepSWE - 65.9% против 70% у Fable и 73% у Sol.
Контекст 500К, на входе текст и изображения. Цена осталась $2/$6 за миллион токенов, после 200К входного контекста тариф повышается. Fast-версия вдвое дороже. Уже доступна в API, Grok Build, Cursor, OpenRouter и других нормальных местах обитания агентов.
Блогпост, Документация
Z.ai: GLM-5.3
Архитектуру GLM-5.2 особо не трогали - основное улучшение получили за счет масштабирования посттрейна. В результате DeepSWE вырос с 46.2% до 66.9%, а CyberGym - до 84.5% (у Fable и Sol 83.8%).
Последнее оказалось настолько хорошо, что открытие весов отложили примерно на две недели для дополнительной проверки кибербезопасности. Пока GLM-5.3 доступна через Z.ai и API. Потихоньку уходит от нас опенсорс.
Блогпост, Документация
Google: Gemini 3.7 Flash
Модель с перформансом между Terra и Sonnet, но дешевле. На Terminal-Bench 2.1 модель выросла с 78% у 3.6 Flash до 85.8% (87.4% у Terra, 80.4% у Sonnet), на DeepSWE — с 48.6% до 65.3% (70% Terra, 54% Sonnet). Стала дефолтной моделью для управляемого агента в Antigravity.
Принимает текст, изображения, видео, аудио и PDF. Контекст 1М, выход до 65К. До конца 2026 года действует стартовая цена $0.75/$3.75 за миллион токенов, после чего ее обещают удвоить, ведь через 5 месяцев модели августа 2026 будут актуальны с такой плотностью релизов
Описание модели, Model Card
Meta: Muse Glimmer 30B
Glimmer дистилят на 30B из Muse Spark для локальных агентов: есть reasoning, tool use, код, изображения на входе и 131К контекста. По кодингу на уровне или чуть хуже Qwen3.6-27B, но выигрывает на агентных бенчах.
Веса, GGUF
Alibaba: Qwen3.8-2.4T-A95B и Qwen3.8-27B
Alibaba как и обещала открыла веса двух Qwen3.8. Большая - MoE на 2.4T параметров и 95B активных, маленькая - 27B. У обеих 262К нативного контекста с возможностью растянуть до 1М.
Веса 2.4T, Веса 27B
DeepSeek: V4 Pro 0813 и свой Harness
еще одно обновление V4 Pro. По официальной карточке это 1.6T параметров и 49B активных. Контекст 1М, максимальный выход 384К. На Terminal-Bench 2.1 модель набрала 87.9%, на DeepSWE 62.7%. Доступна в приложении, вебе и API, где для нее отдельно адаптировали Responses API под Codex.
А еще у них теперь свой ClaudeCode, заявлено все по последней моде, пока в превью.
Обновление, Модель, DeepSeek Harness
Исследователи рексиса из Т-Технологий выступили на ACM KDD 2026 (A*, Южная Корея, 9–13 августа) с техрепортом о T-ECD — одном из крупнейших в мире обезличенных датасетов пользовательских взаимодействий. В открытый доступ его выложили ещё прошлой осенью. Скачать можно с Huggingface: https://huggingface.co/datasets/t-tech/T-ECD
С полей конференции команда разослала датасет руководителям академпрограмм и профессорам крупнейших ИТ-вузов России. Так же сделали гайд по работе с ним с идеями исследовательских задач: https://github.com/kliakhnovich/tecd-quickstart
Рексис в целом очень закрытая сфера в которую непросто вкатиться. В этом году я прослушал 5+ одинаковых дипломов про рекомендательные системы как член приемной комиссии. Поэтому я радуюсь, что у студентов появится возможность взять этот датасет в курсовые, дипломы и лабы и сделать что-то поинтереснее: модельки теперь можно учить не на синтетике и не на MovieLens десятилетней давности, а на данных, приближенных к реальному бизнесу.
Датасет огромный — 135 млрд взаимодействий, поэтому есть и small-версия. В гайде расписаны сценарии от "GPU вообще не нужны" до 8×H100, так что студенты без карточек тоже в деле.