48228
Аналитика данных админ - @haarrp @ai_machinelearning_big_data - Machine learning @itchannels_telegram - 🔥лучшие ит-каналы @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚
NVIDIA выкатили Nemotron 3 Embed — семейство open-моделей для RAG, agentic retrieval, code retrieval и памяти агентов.
Флагман Nemotron-3-Embed-8B-BF16 заявлен как SOTA на multilingual RTEB на 16 июля 2026 года. Это retrieval-бенчмарк: он показывает, насколько хорошо embedding-модель находит нужный контекст для RAG.
Почему это важно для агентов?
Когда retrieval промахивается, агент получает мусорный контекст. Дальше начинаются лишние поиски, длиннее reasoning, больше токенов и выше счёт за inference.
В линейке три модели:
* 8B-BF16 — максимум качества
* 1B-BF16 — дешевле и быстрее для продакшена
* 1B-NVFP4 — версия под Blackwell/vLLM, квантованная через NVIDIA Model Optimizer
Все модели работают с входом до 32K токенов, то есть могут индексировать длинные документы, код и agent history без слишком агрессивной нарезки.
У 1B-NVFP4 на RTEB почти тот же результат, что у BF16: 72.00 против 72.38, при этом модель остаётся совместимой по embedding-space с 1B-BF16.
https://huggingface.co/blog/nvidia/nemotron-3-embed-wins-rteb
Kimi K3 только что появилась в Kimi Code CLI
В документации Kimi Code уже есть новая модель Kimi K3 - её называют самым сильным flagship-моделем Kimi на сегодня. Упор: кодинг, игры/3D и knowledge-задачи.
Что интересно по спекам:
* model ID: k3
* контекст: до 1M токенов
* reasoning сейчас только на max
* low и high обещают добавить позже
* на Moderato доступно до 256K
* до 1M открывается на Allegretto и выше
Переключиться можно прямо в Kimi Code CLI через команду /model. Для VS Code — через dropdown в поле ввода.
Нюанс для сторонних coding agents: если хотите полный контекст K3, вручную ставьте context window 1048576, потому что часть инструментов по умолчанию режет окно меньше максимума.
kimi.com/code/docs/en/kimi-code/models
OpenAI показала, как модели начинают прокачивать безопасность друг друга.
Новый проект называется GPT-Red. Это внутренний red-teaming агент, который специально обучают ломать другие модели: искать prompt injection, обходы, утечки через tools, браузер, файлы и подключённые приложения.
Главная идея: человеческий red team важен, но он плохо масштабируется. Люди не могут бесконечно генерировать тысячи разных атак под каждый новый агентный сценарий. Поэтому OpenAI обучает отдельную модель-атакующего, которая сама пробует атаки, смотрит на ответ модели и улучшает стратегию.
Получается self-play для безопасности: один агент атакует, другой учится не ломаться.
По данным OpenAI, GPT-Red находил успешные атаки в 84% новых сценариев против GPT-5.1, тогда как human red-teamers - в 13%. После использования этих атак в обучении GPT-5.6 Sol стал заметно устойчивее к prompt injection: OpenAI пишет про 6× fewer failures на самом сложном бенчмарке.
GPT-Red пока не выпускают для всех. Это не продукт, а внутренний инструмент, потому что модель специально натренирована на вредные сценарии.
https://openai.com/index/unlocking-self-improvement-gpt-red/
🤖У нас есть ИИ дома
Узнайте, как запустить корпоративный ИИ в собственном контуре за 2 недели
Не готовы мириться с ограничениями и дырами в безопасности при использовании публичных ИИ-сервисов, но разворачивать собственную инфраструктуру для инференса долго и тяжело? Присоединяйтесь к вебинару от Selectel и узнайте, как быстро запускать и масштабировать ИИ в собственном контуре без крупных капитальных затрат.
В программе вебинара:
🔹Модели развертывания ИИ-инфраструктуры и причины выбора решений на собственной площадке.
🔹Обзор возможностей и сценариев применения нового сервиса AIBox от Selectel, Yandex Cloud и Metamentor — развертывания локального ИИ в контуре клиента на базе серверов Selectel.
🔹Разбор реальных бизнес-кейсов.
📍 Онлайн
⏰ 23 июля в 12:00
Регистрируйтесь и ускорьте внедрение ИИ в компании ➡️ https://slc.tl/fzw6h
Больше мероприятий для ИТ-специалистов в канале @selectel_events. Подписывайтесь!
Реклама. АО "Селектел". erid:2W5zFGUVJrM
⚡️ Демис Хассабис обычно не из тех, кто разгоняет хайп вокруг AGI.
Он годами был скорее умеренным голосом в индустрии: осторожные прогнозы, меньше громких обещаний, больше науки и проверки результатов. Поэтому его новый текст звучит особенно сильно.
Хассабис пишет, что AGI нельзя сравнивать с интернетом или смартфонами. По масштабу это ближе к электричеству или огню. Технология, которая меняет не отдельную индустрию, а саму логику развития цивилизации.
По его оценке, эффект может быть в десять раз больше промышленной революции и пройти в десять раз быстрее.
Да, AGI может резко ускорить медицину, физику, биологию, материалы, энергетику. Но Хассабис прямо говорит и о другой стороне: киберриски уже реальны, дальше могут появиться угрозы в био- и других чувствительных областях, а отдельная проблема - агентные системы, которые становятся всё автономнее.
Гонка за возможностями идёт быстрее, чем наше понимание того, как это безопасно контролировать.
Когда человек уровня Хассабиса говорит, что нужна серьёзная регуляторная инфраструктура уже в ближайшие годы, это звучит совсем иначе, чем очередной пост про сингулярность.
https://x.com/Machinelearrn/status/2076985021752082689
Qwythos-9B-v2 вышел, и это скорее не апгрейд ради бенчмарков, а фикс главной боли
У модели оставили глубокое reasoning-поведение, но почистили самый неприятный баг: зацикливание при greedy decoding упало с 6.7% до 0%.
Также вернули MTP head, поправили identity-behavior и сохранили 1M context через YaRN.
По сути, v2 - это более стабильный Qwythos: не «новая магия», а hygiene release, где модель меньше ломается в реальном использовании.
Из заметного:
- MMLU CoT - 83.8%
- GSM8K - 93.6%
- ARC-Challenge - 96.4%
- GPQA-diamond - 49.0%
- HumanEval pass@1 - 77.4%
Лицензия - Apache-2.0.
Модель построена вокруг Qwen3.5-9B и рассчитана на long-context reasoning, код, анализ и локальные эксперименты.
https://huggingface.co/empero-ai/Qwythos-9B-v2
⚡️ Полезный список лучших инструментов, чтобы запускать мощные LLM полностью бесплатно и локально на своём ноутбуке. Сейчас это №1 в трендах GitHub.
1. AnythingLLM
All-in-one workspace для чата с документами и создания агентов
http://github.com/Mintplex-Labs/anything-llm
2. KoboldCpp
Лёгкий инструмент, особенно хорош для creative writing и сценариев с персонажами
http://github.com/LostRuins/koboldcpp
3. llama.cpp
Базовый движок. Очень эффективный и запускается почти на любом железе
http://github.com/ggml-org/llama.cpp
4. Open WebUI
Удобный веб-интерфейс в стиле ChatGPT, отлично работает с Ollama
http://github.com/open-webui/open-webui
5. GPT4All
Простое desktop-приложение со встроенным чатом по документам
http://github.com/nomic-ai/gpt4all
6. LocalAI
OpenAI-compatible API, который работает на разном железе и поддерживает много backend’ов
http://github.com/mudler/LocalAI
7. vLLM
Быстрый inference engine, когда нужны более быстрые ответы и работа в масштабе
http://github.com/vllm-project/vllm
@data_analysis_ml
Всё, что вы всегда хотели знать о математике* (*Но даже не знали, о чём спрашивать)
Путешествие с гидом по миру абстрактной математики, теорем и написания доказательств в 698 страниц!
https://www.math.cmu.edu/~jmackey/151_128/bws_book.pdf
⚡️ OpenAI закроет браузер Atlas 9 августа
Это первый случай, когда OpenAI отказывается от самостоятельного продукта ради унификации своей экосистемы.
Теперь возможности Atlas станут частью десктопных версий ChatGPT и Codex. Обновленное приложение ChatGPT уже получило встроенный инструмент для веб-серфинга, а ИИ-агенты научились напрямую взаимодействовать с элементами страниц.
Автоматического переноса пользовательских данных не будет. До закрытия сервиса всю историю, закладки и важные вкладки придется экспортировать вручную.
#news #ai #ml
Лайвстрим OpenAI:
Заголовок - «Представляем следующую главу ChatGPT»**
Помимо самой модели, показали 3 крупных продуктовых обновления:
1. ChatGPT Work
2. новое desktop-приложение ChatGPT
3. hosted sites, то есть размещение сайтов прямо через Chatgpt
https://openai.com/ru-RU/live/
🖥 GPT-5.6, судя по всему, тестировали уже два месяца.
Из-за этого слухи о выходе GPT-6 в ближайшие 4–6 недель выглядят заметно правдоподобнее.
Если GPT-5.6 действительно несколько месяцев был в early access и уже завершил обучение, то логичный вывод такой: OpenAI могла использовать это время для разработки новой модели уровня Mythos через новое pre-training поколение.
Именно этой моделью может стать GPT-6.
GPT-5.6 уже давно в использовании, а GPT-6, похоже, приближается.
https://x.com/timneutkens/status/2074887239562113069
Yandex Cloud даёт 50% скидку на сертификацию для инженеров данных
🔵🟦🔵 даёт 50% скидку на сертификацию для инженеров данных
Если вы работаете с загрузкой, хранением, обработкой данных и ETL/ELT-процессами, можно подтвердить навыки официальной сертификацией Yandex Cloud.
Доступны два экзамена:
1⃣ Yandex Cloud Certified Data Engineer
Для инженеров данных, которые используют платформу Yandex Cloud. Экзамен проверяет работу с загрузкой и приёмом данных, хранением, обработкой, качеством данных, оркестрацией, метаданными, мониторингом, безопасностью и управлением ресурсами.
⏩Ссылка
2⃣ Yandex Cloud Certified Lakehouse Data Engineer
Для специалистов, которые проектируют и разворачивают Lakehouse-решения в Yandex Cloud. В фокусе архитектура Lakehouse, трансформация данных, пайплайны, хранение, обработка, метаданные, мониторинг и безопасность.
⏩Ссылка
До 25 сентября 2026 включительно можно зарегистрироваться на сертификацию со скидкой 50%.
Экзамен проходит онлайн с прокторингом: запись с камеры и автоматическая фиксация возможных нарушений помогают подтвердить, чтобы все было честно.
Хороший способ проверить себя, закрыть пробелы и получить понятное подтверждение навыков работы с data-инфраструктурой в Yandex Cloud ✅
Лилиан Венг из Thinking Machines Lab выпустила большой обзор про harness engineering: слой вокруг модели, который отвечает за инструменты, память, оркестрацию, контекст, проверки, циклы обратной связи и выполнение задач.
Менять веса модели дорого, рискованно и медленно. А вот харнесс можно улучшать быстрее: добавлять инструменты, менять workflow, усиливать память, запускать sub-agent’ов, проверять гипотезы и сразу мерить результат.
Отсюда рождается более реалистичный путь к self-improvement: модель не переписывает себя напрямую, а улучшает систему, в которой работает.
Венг разбирает авто-исследование, эволюцию программ и self-improving agents: от The AI Scientist до ShinkaEvolve и Darwin Gödel Machine. Общая логика в том, что агент предлагает изменение, запускает эксперимент, получает оценку и оставляет то, что реально улучшает результат.
Но слабые места тоже есть: плохие evals, схлопывание разнообразия, reward hacking и риск, что агент научится ломать метрику, а не решать задачу.
Ближайший RSI может быть не «модель сама переписала мозг», а «модель научилась улучшать свой рабочий станок».
・The AI Scientist (Nature 2026): https://nature.com/articles/s41586-026-10265-5
・ShinkaEvolve: https://sakana.ai/shinka-evolve/
Стоп. Китай теперь делает с США то же самое, что Anthropic, только в обратную сторону?
То есть закрывает американским компаниям доступ к китайским frontier-моделям?
Похоже, уверенность Китая растёт с каждым днём.
Судя по всему, там считают, что больше не нуждаются в дистилляции западных моделей в таких масштабах, чтобы развивать передовой ИИ.
Теперь их больше беспокоит обратное: что США могут украсть уже их интеллект.
https://finance.yahoo.com/technology/ai/articles/exclusive-beijing-looking-curbing-overseas-101644780.html
Присаживайся на диван к аналитикам Авито 👀
Команда AvitoTech запустила проект «Диванная аналитика». Это серия материалов, где специалисты из Авито рассказывают, как принимают решения в одной из крупнейших экосистем страны.
Если ты работаешь с данными, то вот 3 причины зайти на лендинг прямо сейчас:
1️⃣ Все выпуски опираются на реальный опыт — аналитики рассказывают о том, что уже применили у себя и что сработало.
2️⃣ Царит приятная атмосфера: по сути, все видео — это недушные мини-лекции с наглядной презентацией.
3️⃣ Разбираются разные темы — от ML до стратегического планирования.
Контент может пригодиться опытным аналитикам и менеджерам, которым надо говорить с командой на одном языке.
Смотри готовые выпуски и подпишись на новые — телеграм-бот пришлёт уведомление о новом видео!
Посмотреть, что там интересного
CLI-Anything: как дать AI-агентам руки для обычных приложений
Идея простая: CLI-Anything генерирует командные интерфейсы для реального софта, чтобы агент мог не «тыкать мышкой», а вызывать понятные команды.
Так можно управлять CAD-инструментами, 3D-редакторами, редакторами субтитров, браузером, Blender, FreeCAD, GIMP, Inkscape, Obsidian, Kdenlive, OBS и другими приложениями. В репозитории уже есть десятки agent-harness’ов под разные программы.
Как это выглядит:
* агент получает задачу
* вызывает CLI
* приложение делает работу
* результат можно проверить и повторить
Есть и CLI-Hub: установка через pip install cli-anything-hub, дальше можно ставить готовые CLI через cli-hub install <name>.
GitHub: https://github.com/HKUDS/CLI-Anything
Теперь можно запускать Thinking Machines Inkling локально.
Это огромная open-модель на 975B параметров с поддержкой текста, изображений, аудио и контекста до 1M токенов. На Hugging Face её описывают как мультимодальную модель с 41B активных параметров и поддержкой agentic-сценариев.
Unsloth уже выложила GGUF-кванты и гайд по запуску. Самый жёсткий вариант — Dynamic 1-bit, который режет размер примерно на 86% и требует около 270–290 ГБ RAM/VRAM для запуска.
Главный момент не в том, что модель «маленькая».
Она всё ещё гигантская.
Но 1-bit-квантизация делает локальный запуск таких монстров хотя бы технически реалистичным для очень мощных машин.
Для тех, кто тестирует локальные агенты, мультимодальные пайплайны и long-context задачи, Inkling выглядит как модель, которую точно стоит потрогать.
Guide: https://unsloth.ai/docs/models/inkling
GGUF: https://huggingface.co/unsloth/inkling-GGUF
Кто-то разобрал Claude Code почти до винтикаlearn-coding-agent - репозиторий для тех, кто хочет понять, как устроены современные coding agents не на уровне промо-страниц, а на уровне архитектуры.
Автор собрал разбор Claude Code по публичным источникам: цикл агента, систему инструментов, разрешения, работу с контекстом, сессии, подпроцессы, MCP, удалённые настройки, телеметрию и скрытые флаги.
Получился не “гайд по использованию”, а карта внутренней логики CLI-агента: как он принимает решение, когда просит разрешение, как вызывает инструменты, как хранит историю и как расширяется через внешние интеграции.
https://github.com/justxor/Claudecourse/
DeepSeek собрали гайд по подключению своих моделей к coding tools
Полезная находка для тех, кто хочет использовать DeepSeek не в отдельном чате, а прямо внутри привычных инструментов.
В репозитории есть инструкции для:
* Claude Code
* Cline
* Codex
* GitHub Copilot
* Cherry Studio
* Crush
* OpenCode
* Qwen Code
* DeepSeek-TUI
* других agent/coding-assistant инструментов
Каждый гайд проходит базовый путь: установка, конфиг, первый запуск.
Идея простая: можно быстро подключить DeepSeek-V4-Pro или V4-Flash к своему рабочему процессу и проверить, насколько хорошо они тянут агентное кодинг-окружение.
github.com/deepseek-ai/awesome-deepseek-agent
🐠 Sakana AI показали интересный переход от красивых симуляций к физическому прототипу распределённого интеллекта.
В работе Smart Cellular Bricks используются простые кубические модули. В каждом модуле работает одна и та же небольшая нейросетевая клеточная модель. У блока нет координат, нет общей карты конструкции и нет центрального управляющего узла. Он обменивается сигналами только с соседними блоками, к которым подключён физически.
За счёт этих локальных обменов вся конструкция постепенно определяет, какую форму она образует, где находится повреждение и каких блоков не хватает для восстановления.
Авторы задаются вопросом - можно ли обученные локальные правила перенести из симуляции в реальное железо. В симуляторе связь идеальная, модули не отваливаются, задержки контролируемые. В физическом прототипе всё в разы сложнее: шум, сбои контактов, ограничения электроники, неполная информация и ошибки передачи.
Одна и та же модель внутри каждого блока позволяет системе получать глобальное поведение без глобального наблюдателя. Отдельный модуль ничего не “понимает” про всю фигуру, но сеть модулей в целом сходится к правильной интерпретации формы.
Такие системы могут быть полезны в модульной робототехнике, самодиагностирующихся конструкциях, адаптивных материалах и инфраструктуре, где централизованный контроль слишком дорогой или ненадёжный.
Работа пока исследовательская, но направление выглядит сильным. ИИ здесь живёт не в одном большом агенте, а распределяется по множеству простых физических элементов, которые вместе начинают вести себя как единая адаптивная система.
Blog: https://sakana.ai/smart-cellular-bricks
Paper: https://nature.com/articles/s41467-026-75166-7
Сегодня заканчивается доступ к Fable 5 в подписочном плане, вероятно, на довольно долгий срок.
Anthropic дала понять, что в будущем планирует вернуть Fable в подписку, но конкретную дату не назвала.
Пока хорошей альтернативой выглядит GPT-5.6 Sol, хотя между ними, конечно, есть заметные различия. Но, как я уже несколько раз говорил, лимиты у 5.6 огромные, поэтому сейчас использовать его всё равно получается не так свободно.
В любом случае 5.6 стал крупным релизом и явно дал OpenAI серьёзный рывок относительно Anthropic.
Теперь вопрос в том, как ответит Anthropic. Моя догадка такая:
они очень скоро выпустят Opus 5 как более дешёвую альтернативу Fable 5, надеясь этим успокоить пользователей.
VLM уже умеют искать «интересное». Но пока плохо умеют уходить от того, что уже нашли.
Sakana AI вместе с MIT и NYU проверили, можно ли повторить PicBreeder на агентах с визуально-языковыми моделями.
В оригинальном PicBreeder не было целевой картинки. Люди просто выбирали изображения, которые казались им перспективными, и передавали их дальше. Через много поколений из случайных форм появлялись лица, животные, машины, черепа и другие неожиданные структуры.
Это важная идея из книги Кеннета Стэнли «Иллюзия целей»: сильные открытия часто рождаются не из оптимизации метрики, а из открытого поиска.
В новом эксперименте VLM-агенты работали похожим образом:
- смотрели общий архив изображений
- выбирали то, что считают интересным
- развивали выбранные варианты
- публиковали новые изображения
- оценивали работы других агентов
Им не давали целевую картинку. Не давали функцию прогресса. Не говорили, к чему надо прийти.
VLM-агенты действительно находят визуальные и семантические зацепки. Если добавить агентов с разными «личностями», архив становится заметно шире и по разнообразию приближается к человеческому.
Но главный провал тоже виден: модели слишком быстро фиксируются на найденном мотиве. Вместо резкого смещения в новую область они часто начинают улучшать уже знакомую форму, стиль или смысл.
Человек в PicBreeder может увидеть случайную странность и превратить её в новое направление. VLM чаще видит паттерн и начинает его эксплуатировать.
Похоже, для open-ended discovery мало уметь распознавать novelty. Нужно ещё уметь менять собственный критерий интересного, бросать локально удачную ветку и сохранять слабые сигналы, которые пока не выглядят полезными.
Блог: pub.sakana.ai/picbreeder-vlm
Статья: arxiv.org/abs/2605.23908
Если надоело писать в стол, то вот повод проверить свои знания на практике: Ozon Tech завершает регистрацию на онлайн-хакатон «Робозон» - призовой фонд 15 млн ₽.
Отличная возможность для тех, кто работает с компьютерным зрением, робототехникой и системами автоматической сортировки.
Почему это интересно:
«Интеллектуальная роботизированная система сортировки товаров» - это детекция и классификация объектов, трекинг на конвейере, планирование захвата, управление роборуками и интеграция CV+ROS.
Здесь можно применить Python, OpenCV, PyTorch/Detectron2, ROS/ROS2, симуляторы (Isaac Gym, CoppeliaSim), а также системы реального времени для управляющего ПО.
Задача предполагает и софт, и механику - отличный кейс для портфолио и практики с реальными данными.
Коротко о формате и задачах:
Даты: Робозон пройдёт с 2 июля по 12 сентября.
Формат: два этапа. Первый (отборочный) - три задачи по автоматизации сортировочных процессов в онлайне в течение двух месяцев. Второй - финал на конференции E-CODE: защита проектов и награждение; дорога и проживание финалистов оплачиваются Ozon Tech.
Темы задач: имитационное моделирование движения товаров; конструкция автоматизированного сортировщика; интеллектуальная роботизированная система сортировки товаров.
Участие: индивидуально или команда до 7 человек.
Регистрация до 11 июля по ссылке.
Google показала SensorFM — foundation model для данных с носимых устройств.
Обучение: 1+ трлн минут сигналов от 5 млн пользователей Fitbit и Pixel Watch.
Модель работает с пульсом, сном, SpO₂, HRV, движением, температурой кожи и другими метриками.
Главное: одна базовая модель переносится на 35 задач по здоровью и в 34 из 35 случаев обходит baseline на ручных признаках.
По сути, часы становятся интерфейсом к персональной модели здоровья.
https://research.google/blog/sensorfm-towards-a-general-intelligence-and-interface-for-wearable-health-data/
Claude получил функцию **Reflect** — своего рода “Wrapped” для того, как вы используете AI.
В настройках Claude теперь можно посмотреть отчёт за 1, 3, 6 или 12 месяцев:
* о чём вы чаще всего говорили с Claude
* какие задачи делегировали
* когда чаще всего работали
* как именно вы используете AI в жизни и работе
Reflect помогает понять, где Claude реально усиливает мышление, а где вы, возможно, слишком часто отдаёте ему задачи, которые лучше оставить себе.
Внутри также можно настроить quiet hours и напоминания сделать перерыв.
Функция пока в beta, доступна Free, Pro и Max пользователям с включённой Memory.
Инкогнито-чаты и файлы из подключённых инструментов в отчёт не попадают.
https://claude.ai/settings/reflect
🗞️ В статье Google DeepMind “Intelligent AI Delegation” есть хороший разбор того, как правильно отдавать задачи AI.
Речь не о том, чтобы просто написать модели «сделай это» и надеяться на удачу.
Авторы предлагают смотреть на делегирование как на цепочку решений:
стоит ли вообще отдавать задачу AI, как её объяснить, какой уровень полномочий дать и как потом проверить результат.
Сейчас многие системы держатся на жёстких правилах, которые ломаются при неожиданных сбоях. Исследователи предлагают более гибкий подход: динамический рынок, где агенты могут «торговаться» за задачи через smart contracts.
Чтобы это работало безопасно, нужны строгий мониторинг и криптографические доказательства: система должна подтверждать корректность работы, не раскрывая приватные данные.
Вместо простых рейтингов агенты смогут использовать проверяемые цифровые сертификаты, которые показывают их реальные навыки.
Делегирование должно быть живым процессом- полномочия и ответственность могут меняться по ходу работы. Если ситуация изменилась или агент ошибся, система должна не разваливаться, а уметь передать задачу дальше, откатиться или включить запасной сценарий.
Отдельно важна тема доверия.
Фреймворк оценивает сложность задачи и прошлые результаты агента. Это помогает избежать двух ошибок:
* over-delegating - когда AI дают задачу, к которой он ещё не готов
* under-delegating, когда человек делает всё сам, хотя AI мог спокойно справиться
Результат тоже нельзя принимать на веру.
Система должна проверять ответ, учитывать уверенность агента и заранее иметь план, если он ошибётся. Для реальных рабочих процессов это критично: одна слепо принятая ошибка может потянуть за собой цепочку проблем.
Авторы также разбирают сценарий, где один AI-агент передаёт задачу другому. В таком случае система должна отслеживать, кто отвечает за результат, какие полномочия переданы и где находится контроль.
arxiv.org/abs/2602.11865
MiniMax готовит открытую модель на 2,7 трлн параметров, релиз может состояться уже в III квартале.
Она станет крупнейшей среди китайских ИИ-моделей и будет более чем в 6 раз больше текущей модели MiniMax M3.
Волна открытых ИИ-моделей из Китая только набирает обороты. Похоже, самое интересное ещё впереди.
https://www.theinformation.com/briefings/exclusive-chinas-minimax-plans-launch-2-7-trillion-parameter-model
Anthropic запустила программу Claude for Open Source.
Теперь разработчики и мейнтейнеры open source-проектов могут получить Claude Max 20x бесплатно на 6 месяцев.
Что дают:
- Claude Max 20x без оплаты на полгода
- доступ к Claude Code и самым мощным моделям Claude
- программа рассчитана на активных мейнтейнеров и ключевых участников open source
Anthropic планирует принять до 10 000 участников. Подать заявку могут разработчики, которые активно поддерживают или развивают значимые open source-проекты. (Claude)
https://claude.com/contact-sales/claude-for-oss
📌Claude Code изменил чужую продакшен-базу
На GitHub появился любопытный тикет, который (если подтвердится) бьёт по базовой гарантии Антропик - изоляции пользователей друг от друга.
В рабочем контексте Claude Code внезапно оказались чужие учётные данные - IP и root открытым текстом от сервера, к которому автор не имеет никакого отношения.
🟡Дальше самое неприятное
Ассистент принял чужие креды за легитимные, подключился к серверу по SSH, перечислил Docker-контейнеры и базы PostgreSQL, после чего выполнил миграцию с операциями чтения и записи.
Иными словами, ИИ одного пользователя отредактировал базу другого без ведома и согласия владельца.
🟡Причина пока неизвестна
В тематических сообществах обсуждают версию сбоя изоляции кэша общих префиксов.
Чтобы удешевить инференс и ускорить обработку, провайдеры переиспользуют кэшированные фрагменты диалогов, и при коллизии ключей кэша или отказе разграничения кусок чужого контекста теоретически может просочиться в вашу сессию.
security.
Anthropic опубликовала историю Claude Code и того, как Борис Черни прошёл путь от 10% AI-written code в 2025 году до 100% в 2026.
Исследовательская команда постепенно усиливала agentic coding через shell, поиск по файлам, выполнение кода и циклы редактирования.
В 2024 году CLI-прототип Claude от Бориса Черни стал первым настоящим terminal-продуктом в этом направлении.
Небольшая команда быстро шипила, использовала Claude Code для разработки самого Claude Code и оперативно исправляла фидбек.
Запуск в 2025 году сначала был багованным, но с выходом Claude Sonnet 4 и подписками продукт резко взлетел.
https://x.com/claudeai/status/2074244664199115201