rybolos_channel | Unsorted

Telegram-канал rybolos_channel - Kali Novskaya

18169

Нейросети, искусство, мысли. Поехали! Разрабатываю LLM и веду команды chatGPT, GPT-3, GPT-4

Subscribe to a channel

Kali Novskaya

Через полчаса начинаем!
Приходите!

Читать полностью…

Kali Novskaya

🌸Замедление и ускорение 🌸
#не_про_nlp

Поворчу, пока идут разговоры о том, что обучение моделей надо замедлить, а то и вовсе приостановить. Прошла незаметной новость о том, что Alibaba выложили в опен сорс модель, диагностирующую 150 заболеваний по КТ снимкам, в том числе несколько видов рака.
🟣HF Damo Radar https://huggingface.co/Alibaba-DAMO-Academy/RADAR
Модель уже протестировали на 400тыс клинических случаев и в разных больницах — модель оказалась в большинстве случаев точнее радиологов. Вышла публикация в Science

Нет сил, если честно, читать и комментировать все эти новости о том что там где замедлили (читай: где кончились деньги и кому надо нагнать страха перед IPO), но в конечном счёте, все сводится как обычно, к управленческой воле.

Можно использовать и применять ИИ для решения всех важнейших проблем человечества:
🟣 улучшение качества и доступности диагностики
🟣 улучшение стандартов и доступности образования
🟣 лучшее прогнозирование спроса и предложения, моделирование экономических процессов
🟣 ускорение научного прогресса во всех моделирующих науках.

А можно вместо этого стремиться все зарегулировать, убрать конкурентов, довести до аварии, чтобы подсесть на гос бюджет.

Увы, это не технологическая проблема.

Читать полностью…

Kali Novskaya

🌸AI Research Preference Model🌸
#nlp #про_nlp #nlp_papers

Сегодня опять про скаффолды для агентов. Мы уже говорили про то, хорошая ли идея применить сверху preference models для оценки потенциала идей (спойлер: нет). А что, если попробовать обучить такую preference-модель не на вкусовщине (новизна идеи, "вкус", интуиция и т.д.), а на верифицируемом сигнале? Про это наша новая статья — “AI Research Preference Models”.

🌸TL;DR

Главная проблема: AI-агент может быстро придумать множество вариантов эксперимента, но полноценный запуск каждого варианта — обучение модели и оценка результата — требует часов работы GPU. Поэтому критически важно заранее понять, какие идеи действительно стоит проверять.

Мы предлагаем Research Preference Model (RPM) — модель, которая сравнивает несколько предложенных решений и выбирает наиболее перспективное до их полного запуска. В идеале, такая модель может выучить паттерны лучших практик МЛ, чтобы использовать эту информацию для попарного сравнения экспериментов, какой будет более перспективным.
Рассматриваются два варианта:
Inference-only RPM анализирует планы, код и результаты предыдущих экспериментов только при помощи рассуждений LLM.
Agentic RPM дополнительно проводит дешёвые пилотные эксперименты: запускает сокращённое обучение (5 минут, 30 минут, 4 часа), проверяет код и использует полученные метрики для выбора.

🌸Агент
RPM встроена в исследовательского агента AIRA-dojo. На каждом шаге агент генерирует 15 вариантов продолжения, после чего RPM проводит попарное сравнение и отправляет на полноценный запуск только победителя.

🌸Данные
Эксперименты проведены на 20 задачах AIRS-Bench, охватывающих языковое моделирование, математику, биоинформатику и временные ряды. Каждому запуску предоставлялись 24 часа на одной H200 GPU.

🌸Основные результаты
обычный AIRA-dojo: 0,684 среднего нормализованного балла;
с Inference-only RPM: 0,711;
с Agentic RPM: 0,729;
теоретически достижимый результат: 0,748.
Обе RPM достигают результата обычного 24-часового агента примерно за 15 часов, то есть требуют примерно в 1,5 раза меньше вычислений. Кроме того, были получены новые SOTA:
94,1% на WinoGrande против прежнего агентного SOTA 90,4%;
95,7% на SVAMP против опубликованного человеческого SOTA 94,2%.

🌸Главный вывод статьи:
прогресс исследовательских агентов зависит не только от способности генерировать хорошие идеи, но и от умения выбирать, какие идеи заслуживают дорогой экспериментальной проверки. Дополнительные вычисления выгодно тратить не только на генерацию решений, но и на их предварительный отбор, основанный на предсказуемых и верифицируемых сигналах.
Сигнала от мини-версии эксперимента, с первых 5 минут, бывает вполне достаточно!
Проверено на одном скаффолде, но для всех tree-search подходов такой апгрейд должен сработать.

🟣Arxiv https://arxiv.org/abs/2608.13940
🟣Alpharxiv https://www.alphaxiv.org/abs/2608.13940

Читать полностью…

Kali Novskaya

Будем делать субботний мемотред? #шитпост

Читать полностью…

Kali Novskaya

Сегодня выступила на разогреве у Шмидтхубера 🥹

🟣https://www.superintelligenceconference.org

Читать полностью…

Kali Novskaya

Ещё больше рецептов подвезли:

🟣NVidia blog про модель: https://developer.nvidia.com/blog/run-local-agentic-ai-workflows-with-metas-muse-glimmer-on-nvidia/
🟣NVidia NIM контейнер: https://catalog.ngc.nvidia.com/orgs/nim/meta/containers/muse-glimmer/-

🟣VLLM inference https://recipes.vllm.ai/meta-models/Muse-Glimmer-30B

🟣SGlang inference https://docs.sglang.io/cookbook/autoregressive/Meta/MuseGlimmer

🟣AMD + LM Studio https://www.amd.com/en/blogs/2026/run-meta-muse-glimmer-30b-on-amd-ryzen-ai-max-and-radeon-gpus.html

Читать полностью…

Kali Novskaya

Обещают большую модель (Muse Spark 1.2, с которой дистиллили) тоже выложить

Читать полностью…

Kali Novskaya

🌸Релизим Muse Glimmer 30B 🌸

Впервые за долгое время, наконец-то релизим большой командой новую открытую LLM от Meta Superintelligence Labs.
Веса под Apache 2.0!

🌸Что это за модель:
— 30B dense модель, дистиллированная версия Muse Spark для локального инференса на 1 GPU
— юз-кейсы: OpenClaw, MCP, и агентные тулзы
— общие способности (ризонинг, знания, кодинг) тоже на высоком уровне для модели такого размера.
— очень быстрый инференс: 233 токена/сек на 5090 благодаря DFlash spec decoding
— по ключевым способностям — агентные воркфлоу, swe bench, ризонинг — лучше Qwen 3.6 и Gemma 4 31B
— есть мультимодальный инпут (картинки и видео)
— больше 100 языков в претрейне
— контекст 131к токенов
— есть perception encoder (1.8B) в дополнение к модели

Пожалуйста, скачивайте, пользуйтесь, — и ждите тех репорт и доки!
На неделе постараемся выпустить инференс у партнёров и доки по деплою на llama.cpp, ExecuTorch, MLX.

🟣Блогпост https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model
🟣 Веса https://huggingface.co/meta-models/Muse-Glimmer-30B
🟣Доки: (пока что такие же как у Muse Spark) https://dev.meta.ai/docs/cookbook

Читать полностью…

Kali Novskaya

У меня на этой неделе был юбилей — два года в компании.

Было 100500 сокращений и реоргов, перестала считать. Пришла в LLama, сейчас я в Meta SuperIntelligence Labs занимаюсь рисерч-агентами.

По статистике, два года — это рубеж 50%: половина людей в компании меньше этого срока, а половина больше. Многие приходят и уходят быстро, и чем выше левел, тем выше вероятность отвалиться в первый год. Но если не уволился за первые два года — считай есть шанс протянуть подольше, так как дальше хвост распределения растягивается медленно. #карьера #не_про_nlp

Ну, еще покурим!😈

Читать полностью…

Kali Novskaya

Вот такую писюльку получил 5 минут назад.

Нахуй Хабр. Не пишите туда, не читайте его.

Датасет я не закрою, пока они не соизволят написать нормальное письмо.

После этого сделаю приватным, если кому-то будет нужен - пишите в личку. А лучше скачайте сейчас.

Читать полностью…

Kali Novskaya

Пятница! Нужен мемотред #шитпост

Читать полностью…

Kali Novskaya

🌸Без Claude: подборка OSS агентных и кодинг-моделей 🌸
#nlp #про_nlp

В последнее время буквально каждую неделю был большой OSS релиз, и все примерно на одну тему: разворачиваем кодинг и агентные модели без Anthropic/OpenAI.

🌸Cohere North mini 🔥
Хорошая модель с сильными способностями к кодингу, можно инференсить FP8 на одной H100, инференс оптимизирован. Пока что (на этой неделе) гордое звание европейской SOTA для моделей такого же размера. Qwen 3.6 лучше по основным метрикам, но экспортный контроль их не всем разрешает.
MoE 30B-A3B, лицензия Apache 2.0
🟣https://cohere.com/blog/north-mini-code

🌸Poolside Laguna XS.2
Конкурент Cohere North mini, модель так же хороша на кодинг-бенчмарках. Разница в метриках в пределах погрешности.
MoE 33B-A3B, Apache 2.0
🟣https://huggingface.co/poolside/Laguna-XS.2
🟣https://poolside.ai/blog/introducing-laguna-xs2-m1

🌸Семейство Gemma 4
Diffusion Gemma — Мультимодальная модель с дискретным диффузионным декодированием вместо авторегрессивного, что дает значительный прирост скорости инференса. MoE 26B-A4B, Apache 2.0.
🟣https://huggingface.co/google/diffusiongemma-26B-A4B-it
🟣https://blog.google/innovation-and-ai/technology/developers-tools/diffusion-gemma-faster-text-generation/

Gemma 4 — Основная модель семейства с сильными общими способностями, выходит в двух вариантах (MoE 26B-A4B и Dense 31B). Хороший баланс качества и размера — Dense 31B влезает на одну GPU.
MoE 26B-A4B, Dense 31B
🟣https://huggingface.co/google/gemma-4-31B-it

Function Gemma — версия для tool calling: структурированный вывод вызовов функций, парсинг аргументов, поддержка параллельных и вложенных вызовов.
MoE 26B-A4B, Apache 2.0
🟣https://blog.google/innovation-and-ai/technology/developers-tools/functiongemma/

🌸Qwen 3.6
Фокус на агентном кодинге: лучше работает с фронтендом, рассуждает на уровне репозитория, умеет сохранять thinking-контекст между сообщениями. MoE 35B-A3B и Dense 27B, мультимодальная (vision), Apache 2.0.
🟣https://huggingface.co/Qwen/Qwen3.6-35B-A3B

🌸Mellum 12B
Самая маленькая модель из списка, заточенная под кодинг: code generation, editing, debugging, tool use и агентные сценарии. MoE 12B (2.5B активных), 128K контекст, есть Instruct и Thinking варианты, Apache 2.0 — можно крутить на одной потребительской GPU.
🟣https://huggingface.co/blog/JetBrains/mellum2-launch

🌸Kimi K 2.6
Флагман Moonshot AI: MoE ~1T (32B активных), 262K контекст. Ключевая фича — Agent Swarm: модель сама декомпозирует задачу на до 300 параллельных суб-агентов. SWE-bench Pro 58.6%, Terminal-Bench 66.7%. Modified MIT.
🟣https://huggingface.co/moonshotai/Kimi-K2.6

🌸DeepSeek 4 Pro
Самая крупная OSS модель: MoE 1.6T (49B активных), контекст 1M токенов, MIT. Лидер на кодинг-бенчмарках (SWE-bench Verified 80.6%, LiveCodeBench 93.5%, Codeforces рейтинг 3206). Только текст.
🟣https://ollama.com/library/deepseek-v4-pro

🌸GLM 5
MoE 745B (44B активных), 202K контекст. Мультимодальная, хороша на кодинге и агентных задачах (AutoGLM). Лицензия MIT.
🟣https://z.ai/blog/glm-5

🌸Minimax M3
Нативно мультимодальная модель (текст + изображения + видео), MoE ~428B (23B активных), 1M контекст. Основной конкурент Qwen для кодинга. Лицензия не пермиссивная.
🟣https://huggingface.co/MiniMaxAI/MiniMax-M3

🌸IBM Granite 4.1
Семейство enterprise-моделей для кодинга и RAG от IBM. Фокус на лицензионную чистоту данных и trustworthiness. Мне понравился техрепорт про стадии пре- и мидтренинга. Apache 2.0.
🟣https://huggingface.co/blog/ibm-granite/granite-4-1

🌸Mistral family
Magistral — reasoning-модель, обучена чистым RL, мультиязычная, прозрачный chain-of-thought. Small 24B (open-source) и Medium (closed).
Devstral — кодинг-модель для агентных задач, оптимизирована для Vibe CLI.
Codestral — специализированная модель для code generation, 80+ языков.
🟣https://mistral.ai/news/mistral-small-4/

🌸Community Finetunes:
Файнтюны на Qwen3.6 и Gemma 4 с "uncensored" мышлением — для тех, кому нужна модель без ограничений на генерацию.
🟣Qwen 3.6
🟣Gemma 4

Читать полностью…

Kali Novskaya

На этой неделе в Мете был очередной лэйофф. В честь этого срочно нужен выживальческий мемотред! #шитпост 

Читать полностью…

Kali Novskaya

🌸Papers with Code жив!🌸
#nlp #nlp_papers #про_nlp

HuggingFace официально воскресили легендарный ресурс — и даже добавили новый функционал!

Теперь наконец-то можно отслеживать
- растущий тренд в направлениях ИИ-исследований
- следить таргетно за статьями в наших любимых отраслях: World Models, Agents, RL, Robotics, и многих других!

Вернулись вкладки с бенчмарками и метриками по разным отраслям (и их много!) и все статьи тоже новые, интегрированные через HuggingFace papers.

Новая вкладка — методы — доступна со статьями в самых разных доменах. Можно посмотреть все статьи, где используется rlvr, например.

Большой шаг для воспроизводимости в МЛ-рисерче!

🟣https://paperswithcode.co/

Читать полностью…

Kali Novskaya

🌸Пост про то, как справиться с выгоранием🌸

Я не знаю!

Читать полностью…

Kali Novskaya

🌸Стрим на Рабкоре 20.00 мск🌸

Вчера такая дискуссия разгорелась, давайте делать стрим.
На Рабкоре в 20 по мск, 18 по Лондону.
Поговорим про замедление, зачем оно вообще нужно, согласится ли Китай?

Приходите!

🟣Youtube: https://www.youtube.com/live/kMbfjDBtjew?is=yQUIZLGn0mQ18vcq

Читать полностью…

Kali Novskaya

Ну и подкаст от Alpharxiv, конечно

Читать полностью…

Kali Novskaya

Шмидтхубер написал, что он первый придумал Recursive Self-improvement в 1987 году.

Наконец-то, а то мы уже стали переживать

https://people.idsia.ch/~juergen/recursive-self-improvement.html

Читать полностью…

Kali Novskaya

Поскольку на этой неделе все обсуждают возможное решение (и воровство) Навье-Стокса (краткое содержание у Ильи Гусева), то самое время вспомнить, что проблема научной атрибуции результатов при использовании ИИ в науке уже была описана как риск в Лейденской декларации о ИИ и математике.
Многие отдельные учёные и институты уже подписали декларацию (а некоторые учёные, например, Vladimir Lazic, заняли ещё более строгую позицию).

И вот теперь такой прецедент — то ли доказательство частично украдено, то ли нет.

Что предписывает декларация:
🟣 Раскрывайте использование инструментов: указывайте, какие ИИ и программы использовались.
🟣 Помогайте рецензентам: давайте ссылки и проверяемые доказательства.
🟣Следуйте открытой науке: делайте исследования прозрачными и доступными.
🟣 Отвечайте за корректность: ответственность всегда остаётся за авторами.
🟣 Сохраняйте человеческое авторство: ИИ не является автором работы.
🟣 Корректно указывайте источники: тщательно атрибутируйте идеи и результаты.
🟣 Участвуйте в публичной дискуссии: объясняйте обществу результаты, полученные с ИИ.
🟣 Следите за технологиями: понимайте возможности новых ИИ-инструментов.
🟣 Приветствуйте новых участников: делайте математическое сообщество открытым.
🟣 Осознанно выбирайте инструменты: учитывайте их открытость, эффективность и ценности.
🟣 Учитывайте этические последствия: избегайте исследований и партнёрств, способных причинить вред.


Сюда бы можно было добавить ещё целый пункт про использование опен-сорсных моделей, хоть это и требует ресурсов. Я лично не верю, что OpenAI тяжело проверить, какие примеры попали в обучение модели, так как примеры всегда максимально фильтруются и проверяются на абляционных исследованиях.


🟣https://leidendeclaration.ai/

Читать полностью…

Kali Novskaya

🟣Ollama тоже вышла
https://ollama.com/blog/muse-glimmer
https://ollama.com/library/muse-glimmer

Читать полностью…

Kali Novskaya

🟣Unsloth
Вышла квантизация Unsloth https://huggingface.co/unsloth/Muse-Glimmer-30B
https://huggingface.co/unsloth/Muse-Glimmer-30B-GGUF

И подробный гайд https://unsloth.ai/docs/models/muse-glimmer

🟣MLX
MLX — тут будут версии fp4, 8bit и другие https://huggingface.co/models?other=base_model:finetune:meta-models/Muse-Glimmer-30B

Читать полностью…

Kali Novskaya

Сделали Muse Glimmer лендинг и коллекцию на HF — теперь отдельно лежат
🟣30B — основная модель, посттрен веса
🟣30B assistant — голова для спек декодинга
🟣GGuf для llama.cpp
🟣Executorch PTE веса

Выкатили Executorch документацию
🥹😈

Читать полностью…

Kali Novskaya

Для борьбы с выгоранием — пятничный мемотред! #шитпост

Читать полностью…

Kali Novskaya

Илья мб и грубовато написал, но в целом весь ML опен сорс держится на людях, которые бесплатно трудятся и берут на себя такие огромные риски. Если каждый ресурс будет кошмарить авторов датасетов, никаких открытых LLM не будет. Удивительно это видеть от Хабра.

Американское же прецедентное право в этом смысле очень явно выразилось: это Fair use.

Читать полностью…

Kali Novskaya

🌸Harness Engineering for Recursive Self-improvement🌸
#nlp #про_nlp

Отличный обзор на все текущие работы о self-improving scaffolds

🟣https://lilianweng.github.io/posts/2026-07-04-harness/

Читать полностью…

Kali Novskaya

🌸AI Can Learn Scientific Taste🌸
#nlp #про_nlp

Как отличить хорошую научную идеи от средней? Часто говорят об интуиции или вкусе, которые годами вырабатывают ученые. А можно ли его передать LLM?

🌸TL;DR
Интересная статья из списка для чтения: "AI Can Learn Scientific Taste".
Авторы предлагают эксперимент на большом объеме публикаций: можно ли попробовать обучить LLM "вкусу" к импактным идеям без формального определения.
Проблема сформулирована как 2 способности:
🟣judgement capability — способность ранжировать пары идей — и объяснять, почему
🟣ideation capability — способность генерировать внятные новые научные идеи.

Чтобы сравнивать идеи между собой, авторы используют количество цитирований как прокси-метрику — у какой статьи цитирований больше, та и лучше.
В рамках экспериментов получены
🟣Модель Scientific Judge — SciJudge на базе GRPO на цитированиях
🟣Полиси-модель Scientific Thinker, которая учится генерировать научные идеи, используя сигнал от SciJudge и обновляя политику на базе comparison-based GRPO

Scientific Judge вполне убедительно побеждает в качестве попарного ранжирования статей в сравнении с другими моделями — вин-рейт в районе 70%
Scientific Thinker качественно экспериментально не оценен, но по консенсусу GPT-5.2, GLM-5 и Gemini 3 Pro новизна идей существенная.

Обе модели представлены в формате 4B и 30B, и даже есть некоторое подобие Scaling laws.

🌸Данные

700,000 пар статей из arXiv (заголовки и абстракты)
Пары составлены таким образом, чтобы попарно сравнивались статьи одного времени выхода и области, чтобы избежать разницы в росте цитат во времени.

Помимо Computer Science для обучения, часть данных для оценки качества включает математику, физику и биологию (bioRxiv) — и на этих парах улучшение точности ранжирования тоже сохранилось.

Есть отложенная часть выборки "из будущего": с датой публикации после предобучения базовых моделей. На них качество работы пока что сохранилось.

🌸Может ли это работать?

Может, но в ограниченном количестве случаев.
Какое-то рациональное зерно в попарном сравнении идей одного года и домена может быть вполне полезно, чтобы выучить некоторые паттерны оценки научных идей: насколько идея хорошо масштабируется, есть ли у нее кросс-дисциплинарный потенциал, есть ли новизна и т.д.
Однако, сама метрика цитирований остается слишком шумной, чтобы опираться на нее как есть.
В тому же, саму по себе новизну таким образом определить невозможно, так как у нас есть временная утечка — базовая LLM (Qwen3), конечно, уже имела оцениваемые пары статей в претрейне.

Для меня нет, в общем-то, самого главного эксперимента, который бы показывал результат: end2end улучшение прогресса какого-то агента, использующего такую модель в экспериментах.

"Вкус" к науке остается неопределим, и использовать такие модели стоит с оговорками и уточненным пониманием, чему же мы учим модель на самом деле. Есть гораздо более объективно формализуемые части научных экспериментов.


🟣Paper: https://arxiv.org/abs/2603.14473
🟣Github: https://github.com/tongjingqi/AI-Can-Learn-Scientific-Taste
🟣Модели: https://huggingface.co/OpenMOSS-Team/SciThinker-30B https://huggingface.co/OpenMOSS-Team/SciJudge-30B

Читать полностью…

Kali Novskaya

На неделе выступила в качестве спикера в зазеркальном лондонском аналоге ФКН НИУ ВШЭ: LSE - London School of Economics, Department of Statistics. Поговорили про проблемы ИИ-рецензирования ИИ-статей, и что делать дальше. Даже напечатали меня. 👌

Читать полностью…

Kali Novskaya

🌸Arxiv vs Neurips 2026🌸
#nlp #про_nlp #nlp_papers

Я много пишу про то, что статей, особенно сгенерированных агентами, становится все больше, а рецензентов больше не становится (см тут).
Чтобы решить эту проблему, перейдем ли мы на автоматическое рецензирование?

В этом месяце можно наблюдать, как две основнополагающие структуры в ИИ-сообществе приняли противоположные стратегии относительно ИИ-агентов в исследованиях.

🌸NeurIPS 2026
В этом году я участвую в эксперименте с автоматическим рецензированием!
LLM будут помогать рецензентам оценивать качество статей.
Рецензентам предлагается поучаствовать в контрольных группах для оценки влияния LLM на итоговые решения, причем групп будет три:
— полностью человеческое, экспертное рецензирование
— эксперт + LLM, свободная генерация
— эксперт + LLM, структурированная генерация
🟣https://neurips.cc/Conferences/2026/ai-reviewing-experiment


🌸Arxiv
Администрация Архива, наоборот же, решила не вводить автоматическое рецензирование, а оставить правила как есть, и ввести более строгие правила относительно ИИ-публикаций — статей, очевидно сгенерированных.
Речь идет в основном о следах и артефактах, которые говорят о том, что текст статьи был написан LLM (возможно, вообще без экспериментов).
Теперь все соавторы статьи, отмеченной архивом как сгенерированной, будут получать бан на год.

Твиттер, конечно, негодует. 
🟣https://x.com/tdietterich/status/2055000956144935055

Что думаете?

Читать полностью…

Kali Novskaya

Ладно, раз я начала сегодня платить, то запощу хорошую новость тоже

Читать полностью…

Kali Novskaya

С первым мая!
A garland for May Day
Walter Crane, 1985

Читать полностью…
Subscribe to a channel