Наткнулся на прикольный инструмент от Microsoft - Тренер для AI-инженеров.
Тулза сканирует историю сессий по используемым агентам (Codex, Claude Code etc.) и рисует красивый дэшборд с анализом качества взаимодействия с ЛЛМ.
Из прикольного:
1️⃣ Анализирует частоту антипаттернов в четырех категориях - качество промптов, гигиена сессий, ревью рекомендаций модели, использование инструментов. У меня например все неплохо с промптами и инструментами, а вот внимательнее вычитывать рекомендации ЛЛМ-ки не помешало бы
2️⃣ Дает рекомендации по созданию кастомных скиллов. Сессии анализируются на предмет повторяющихся задач - дальше под них либо предлагается существующий community skill, либо генерится новый.
3️⃣ Собирает кучу красивой и интересной статистики - как распределяется время по проектам, в какие часы выполняется больше работы
4️⃣ Генерит упражнения для саморазвития - на улучшение качества .md файлов и обнаружение ИИ-слопа.
Часть функционала пока сыровата и у меня не завелась, но, учитывая то, как много не-технарей начинает нынче вайб-кодить - инструмент может в итоге оказаться супер-полезным. У нас в конторе по крайней мере постараюсь распространить.
В мобильном/десктопном приложении Claude в Voice Mode появилась поддержка русского
Читать полностью…
https://x.com/karpathy/status/2056753169888334312?s=46
Читать полностью…
7 раз отмерь, 1 раз отрежь
Или самая естественная форма использования мультиагентов в software development - это много read-агентов и 1 write-агент
Полное саммари мнений/методологий по тому, на каких задачах мультиагенты работают хорошо и на каких под вопросом, а также насколько метафора MapReduce здесь подходит:
https://claude.ai/public/artifacts/cce28458-552c-4ddf-a5da-bc7e34c2248c
Окей, две мысли, вот моё чтение:
1. Разработка софта — плохо параллелится
Клод пришёл к выводу (вероятно, ссылался на исследование Фреда Брукса / "The Mythical Man-Month"): разработка упирается в последовательные зависимости. Нельзя параллельно делать клиент и сервер, пока не согласован протокол. Один bottleneck → следующий → следующий. Скрытые coupling-точки сужают поле для параллелизации.
2. Всё остальное — широкое поле для мультиагентов
Ключевой критерий: можно ли обработать задачу независимо, без контекста от других? Если да — параллели. По сути MapReduce, только вместо данных — контекст.
Хорошие кейсы:
- Research — разные методологии, потом агрегация
- Симуляции — 10 агентов, каждый со своей методологией оценки/прогноза
- Тикеты в Linear — 20 тикетов → спавн субагентов, проверить конфликты при merge, если нет — параллельно
- Multi-source investigation — один в Amplitude, другой в Linear, третий в БД, четвёртый в логи. Каждый изолированный источник, не влияют друг на друга
- OpenClaw-паттерн — много issues/feature requests в репо, каждый изолированно + внутри каждого горизонтально: код → security review → code review → тесты
Формула простая: если можешь дать задачу отдельному сотруднику без нужды коммуницировать с другими — можно дать субагенту. И горизонтально (разные задачи), и вертикально (этапы внутри одной задачи).
По сути ты описал закон Амдала для агентов: параллелизируется только та часть работы, где нет зависимостей. В софте зависимостей много, в research/analysis — мало.
Sama wins
Суд присяжных постановил, что Маск подал иск слишком поздно, чтобы признать Альтмана, Брокмана или OpenAI ответственными за какие-либо претензии, предъявленные им генеральным директором Tesla. Присяжные также признали Microsoft невиновной в пособничестве Альтману и Брокману и получении прибыли от сделок с OpenAI из-за сроков подачи иска Маском.
А я правильно понимаю, обсуждение аниме с Клодом классифицируется как суицидальные наклонности?
Читать полностью…
https://x.com/mattepstein/status/2054989194414465222
Читать полностью…
⚙️ Меня немного запарило, что все кодинг агенты не умеют из коробки делать актуальных на сегодня агентов, потому что внутри – модели еще не обучены всем современным агентским трюкам – поэтому я прошелся по исходникам Codex, Claude Code и других популярных уроков по созданию агентов, работу с кешами, авто-сжатием контекста и тп, и собрал скилл agents-best-practices который чинит эту проблему – причем, там отдельно прописано, что эти знания для всех видов агентов, не только для кодинга:
Там нет кода, есть текстовые справочники на темы – мне помогло:
Архитектура агентного harnessЧитать полностью…
Как устроить runtime вокруг модели: контекст, инструменты, permissions, память, наблюдаемость и остановочные условия.
Agentic loop
Базовый цикл: модель → tool call → валидация → permission check → выполнение → observation → следующий шаг или финальный ответ.
System prompts и инструкции
Как проектировать слои промптов: global, workspace, domain-specific, task-level и runtime reminders.
Tools и permissions
Как делать инструменты узкими, типизированными, безопасными, проверяемыми и разделёнными по risk class.
Planning mode
Как отделять планирование от исполнения: read-only exploration, план-артефакт, approval и потом мутации.
Goal-like loop
Как задавать долгоживущие цели с budget, checkpoints, validation criteria и stop condition. Это вместо Ralph Loop.
Context, memory и auto-compaction
Как управлять контекстом, делать retrieval, сохранять рабочее состояние и сжимать историю без потери критичных данных.
Prompt caching и cost-aware context
Как строить стабильные prompt-prefixes, deterministic tool ordering и cache-friendly agent runtime.
Skills и progressive disclosure
Как подключать reusable workflows: короткий skill index сначала, полные инструкции только при необходимости.
MCP и external connectors
Как подключать внешние системы через governed connectors: namespacing, auth, permissions, audit logs и least privilege.
Security, approvals и sandboxing
Prompt injection, secrets, approval flows, draft-vs-commit, sandbox для open-world tools.
Observability и evals
Как логировать agent runs, tool calls, approvals, compactions, failures и тестировать harness на реальные failure modes.
Provider API patterns
Практики для OpenAI, Anthropic и OpenAI-compatible API без привязки к одному провайдеру.
Checklists и coverage audit
Готовые списки для проверки: перед запуском, перед добавлением tools, перед подключением skills/connectors и перед продом.
Второй сезон Атаки на Титанов на фоне первого какой-то тухленький. Даже скучнее второй арки Тетради Смерти или второго сезона Обещанный Неверленд
Буду надеяться что третий не подведёт 💪
Организаторы отлично знают, как много времени уходит на то, чтобы довести проект до идеала. Поэтому они решили пойти всем навстречу и дать еще немного времени, продлив прием заявок на Practical ML Conf 2026!
Для тех, кто переживал из-за самопрезентации: если вы захотите отправить видеовизитку, это легко можно сделать позже, так что пусть этот пункт вас не тормозит. Спокойно заполняйте основную форму сейчас, а видео добавите, когда будете готовы — главное уложиться до 1 июня 23:59.
Чтобы настроиться на нужную волну, загляните в пост с темами коллег прошлой Practical ML Conf. Желаем вам быть такими же крутыми, так что скорее регистрируйтесь и готовьтесь ярко презентовать свои наработки в сфере ML!
#промо
Позавчера у Vibe вышло обновление 2.9, и вот-вот выйдет версия 3.0 где будет много-много вкусного
https://apps.apple.com/app/vibe-app/id6553989941
Как создаются и работают GPU, TPU и другие чипы
https://www.youtube.com/watch?v=oIk3R-sMX5o
Cursor выложили в открытый доступ свой набор скиллов в виде плагина к Cursor (но можно использовать и скиллы отдельно для Claude / Codex)
https://cursor.com/marketplace/cursor/cursor-team-kit
В частности, сказали самый любимый скилл их команды сейчас это
/thermo-nuclear-code-quality-review
Почему в скупе протеина 25г белка?
Второй пост из рубрики #между_ртом_и_очком. Ещё один факт о пищеварении, который я не знал раньше
Раньше я был уверен, что если просто есть необходимое для роста мышц количество белка в день, то всё заебись (обычно в рисерче фигурирует рекомендуемая цифра 1.6-2.2г белка на 1кг тела. например, для 80кг → 128г белка)
Но, закопавшись с Клодом, выяснил что суммарный рост мышц за день увеличивается не просто пропорционально количеству белка, а пропорционально количеству метаболических импульсов за день. Причем белок сверх лимита 30г, да, усваивается, но идёт уже не в рост мышц, а в восстановление органов и тканей
Мне понравилось выражение Клода, что "рост мышц – это НЕ капельница 24/7, а импульсный процесс". Происходят скорее рывки роста на короткие промежутки времени в течение суток – "метаболические импульсы" или MPS – Muscle Protein Synthesis. Эти периоды длятся 2-3 часа после приёмов пищи, в зависимости от источника белка. И вызываются, когда в организм получает "пороговую" порцию белка, 20-25г (а точнее лейцина, ~2.5г, который есть почти во всём белке в слегка разной пропорции)
Метаболический отклик – это пороговая функция, поэтому, как сказал выше, если в приёме пищи достаточно белка, импульс уже случится и величина роста мышц НЕ будет линейно зависеть от количества белка в этом приёме. Пик уже на 30г белка. Если недостаточно, отклик не случится. Протеиновый батончик, где 10-12г белка не вызовет отклик, а вот 2 батончика за присест – уже вполне
Важно, чтобы необходимое количество белка поступало единовременно, в короткий интервал времени. Если 20-25г получаются за 2 приёма пищи разделённых 30-60 минутами, MPS импульс скорее всего уже не возникнет
С другой стороны, после каждого импульса есть порядка 3-4 часов рефрактерного периода (как 20 минут у парней после секса). Если очередной приём пищи (даже с "пороговым" количеством белка произойдёт через 2-3 часа после предыдущего, новый импульс не возникнет и этот белок не засчитается в рост мышц
А какой максимум гипертрофии можно достичь за день? Сколько необходимо MPS импульсов? Ответ: 4-5. На 1 → 2 → 3 рост роста почти линейный. На 3 → 4 уже меньше. На 4 → 5 разница небольшая (те самые diminishing returns). 6 уже потребует жертвовать сном (чтобы было достаточно дистанции между приёмами пищи, а лишение себя сна отрицательно сказывается на восстановлении)
Это всё кстати и ответ на вопрос, почему у Whey протеина порции 25г белка, это необходимое и достаточное количество белка, чтобы вызвать метаболический отклик (к тому же Whey протеин – топ по кол-ву лейцина: 11-12% от белка, а эталон – сывороточный изолят: 14%)
P.S. Хорошая новость: тренировки сами по себе снижают триггерный уровень лейцина, необходимый для MPS импульса. Плохая новость: старение увеличивает (вплоть до 40г белка)
Когда нужно спавнить 10-20 субагентов для решения задачи, а когда нет?
В одном чатике ai блогеров (не ai инфобиз!) задали вопрос, кто как использует мультиагентов, у кого какой опыт – записал голосовое чтобы поделиться своей интуицией, @the_ai_architect превратил его в пост
Создатель OpenClaw умудряется тратить $1.3M токенов в Codex в месяц
https://x.com/steipete/status/2055346265869721905?s=46
Через год-два - все будут рассказывать как создавать rl environments, как сегодня учат как пользоваться Клод кодом.
Читать полностью…
Попросил Клода сообразить себе AI саппорта для Вайба. С внутренней базой знаний, изолированным tool-use, пишущий от лица саппорт-аккаунта (чтобы при эскалации продолжил человек, т.е. я), с приёмом фото/голосовых. Выгрузил ему переписки с пользователями с аккаунта саппорта, накидал пару архитектурных предпочтений
Он справился за 2 часа, пока я смотрел 3-й сезон AoT 😁
Мини кулстори: все кто сидели со мной, работали рядом ржали, когда слышали как я в клод коде стравливаю Илона Маска и Дженсена в попытках решить какую-то техническую проблему (мы же вайб кодеры, диктуем промпты голосом)
У меня есть те самые 2 killer-скилла co-design Дженсена и first principles Илона. Иногда я прошу поразмышлять над какой-то проблемой в форме дебатов между этими двумя. Бывает, они в чём-то не соглашаются, пока вдвоём копают код или данные. Бывает, в чём-то соглашаются почти мгновенно. Но чтиво всегда интересное
Вообще, полезное упражнение, в частности, привыкаешь начинать решение проблемы с удаления ненужных требований ("кто автор такого-то требования? ткните в него пальцем?"), как это делает Илон, или вопросов "а какой тут SOL - Speed Of Light? что здесь физический предел?" (в противовес рыночным бенчмаркам или твоим прошлым рекордам), как это делает Дженсен
Как тратить на LLM не 20-30% выручки, а 5-10%?
– учитесь писать харнессы
Попросил диприсёрч проанализировать слитые исходники Claude Code (OpenCode), опенсорсные OpenClaw, Hermes и других ребят – и собрал супер-мега-полезный playbook по упаковке контекста в своём агенте в виде скилла для Клода
TL;DR: это поможет вам максимизировать cache hit % и снизить себестоимость своего AI-продукта в 3-5 раз
Мини-ликбез для тех, чей CTO работает по подписке:
1) 99% LLM (включая ChatGPT, Claude, Gemini) работают на одной архитектуре - трансформеры. По умолчанию, трансформер на каждый ваш запрос пересчитывает с нуля весь промпт - системную инструкцию, всю историю разговора, ваш новый вопрос. Если в инструкции 10 000 токенов, а вы дописали 50 - она честно прогоняет вычисления по всем 10 050
2) Провайдеры поняли, придумали кеширование промпта. Если начало вашего нового запроса точно совпадает с началом предыдущего - модель не пересчитывает его заново, а берёт готовый результат из памяти. Те токены, которые "попали в кеш", стоят в 10 раз дешевле. Пример из документации OpenAI: https://developers.openai.com/api/docs/guides/prompt-caching
3) Cache hit rate – это % токенов вашего запроса, которые удалось переиспользовать из кеша. 0% – ничего не сэкономили, платите полную цену. 90% – платите ~10% от обычного. Это и есть та переменная, которая отделяет AI-продукт со здоровой экономикой от продукта, который сжигает деньги / перепродаёт токены с минимальной наценкой
4) Правило большого пальца, чтобы попадать в кеш: то, что не меняется (статическая часть) – в начало запроса, то, что меняется/дополняется каждый раз (динамическая часть) – в самый конец. Звучит банально, но 90% команд кладут в начало системной инструкции текущую дату / ID сессии / метку из аналитики / цель (либо злоупотребляют вставками/плейсхолдерами внутри промпта) – и получают 0% попадания в кеш. Каждый запрос для модели выглядит «новым», даже если отличается на 10-20 токенов где-то вначале
5) Норма для хорошо спроектированного AI-агента – 80–90% cache hit rate. Claude Code (агент от Anthropic, на котором сидят разработчики) держит 92% в проде, и команда объявляет инцидент, если показатель проседает
Внутри скилла в папке references/ покрыты все основные провайдеры: Anthropic, OpenAI, Gemini, self-hosted, OSS-agents, а также бенчмарки по индустрии
Произошёл додеп — Anthropic теперь расширили и недельный лимит на 50% (до 13-го июля, на 2 месяца).
Это в дополнение к недавнему удвоению 5-часовых лимитов.