В мобильном/десктопном приложении Claude в Voice Mode появилась поддержка русского
Читать полностью…
https://x.com/karpathy/status/2056753169888334312?s=46
Читать полностью…
7 раз отмерь, 1 раз отрежь
Или самая естественная форма использования мультиагентов в software development - это много read-агентов и 1 write-агент
Полное саммари мнений/методологий по тому, на каких задачах мультиагенты работают хорошо и на каких под вопросом, а также насколько метафора MapReduce здесь подходит:
https://claude.ai/public/artifacts/cce28458-552c-4ddf-a5da-bc7e34c2248c
Окей, две мысли, вот моё чтение:
1. Разработка софта — плохо параллелится
Клод пришёл к выводу (вероятно, ссылался на исследование Фреда Брукса / "The Mythical Man-Month"): разработка упирается в последовательные зависимости. Нельзя параллельно делать клиент и сервер, пока не согласован протокол. Один bottleneck → следующий → следующий. Скрытые coupling-точки сужают поле для параллелизации.
2. Всё остальное — широкое поле для мультиагентов
Ключевой критерий: можно ли обработать задачу независимо, без контекста от других? Если да — параллели. По сути MapReduce, только вместо данных — контекст.
Хорошие кейсы:
- Research — разные методологии, потом агрегация
- Симуляции — 10 агентов, каждый со своей методологией оценки/прогноза
- Тикеты в Linear — 20 тикетов → спавн субагентов, проверить конфликты при merge, если нет — параллельно
- Multi-source investigation — один в Amplitude, другой в Linear, третий в БД, четвёртый в логи. Каждый изолированный источник, не влияют друг на друга
- OpenClaw-паттерн — много issues/feature requests в репо, каждый изолированно + внутри каждого горизонтально: код → security review → code review → тесты
Формула простая: если можешь дать задачу отдельному сотруднику без нужды коммуницировать с другими — можно дать субагенту. И горизонтально (разные задачи), и вертикально (этапы внутри одной задачи).
По сути ты описал закон Амдала для агентов: параллелизируется только та часть работы, где нет зависимостей. В софте зависимостей много, в research/analysis — мало.
Sama wins
Суд присяжных постановил, что Маск подал иск слишком поздно, чтобы признать Альтмана, Брокмана или OpenAI ответственными за какие-либо претензии, предъявленные им генеральным директором Tesla. Присяжные также признали Microsoft невиновной в пособничестве Альтману и Брокману и получении прибыли от сделок с OpenAI из-за сроков подачи иска Маском.
А я правильно понимаю, обсуждение аниме с Клодом классифицируется как суицидальные наклонности?
Читать полностью…
https://x.com/mattepstein/status/2054989194414465222
Читать полностью…
⚙️ Меня немного запарило, что все кодинг агенты не умеют из коробки делать актуальных на сегодня агентов, потому что внутри – модели еще не обучены всем современным агентским трюкам – поэтому я прошелся по исходникам Codex, Claude Code и других популярных уроков по созданию агентов, работу с кешами, авто-сжатием контекста и тп, и собрал скилл agents-best-practices который чинит эту проблему – причем, там отдельно прописано, что эти знания для всех видов агентов, не только для кодинга:
Там нет кода, есть текстовые справочники на темы – мне помогло:
Архитектура агентного harnessЧитать полностью…
Как устроить runtime вокруг модели: контекст, инструменты, permissions, память, наблюдаемость и остановочные условия.
Agentic loop
Базовый цикл: модель → tool call → валидация → permission check → выполнение → observation → следующий шаг или финальный ответ.
System prompts и инструкции
Как проектировать слои промптов: global, workspace, domain-specific, task-level и runtime reminders.
Tools и permissions
Как делать инструменты узкими, типизированными, безопасными, проверяемыми и разделёнными по risk class.
Planning mode
Как отделять планирование от исполнения: read-only exploration, план-артефакт, approval и потом мутации.
Goal-like loop
Как задавать долгоживущие цели с budget, checkpoints, validation criteria и stop condition. Это вместо Ralph Loop.
Context, memory и auto-compaction
Как управлять контекстом, делать retrieval, сохранять рабочее состояние и сжимать историю без потери критичных данных.
Prompt caching и cost-aware context
Как строить стабильные prompt-prefixes, deterministic tool ordering и cache-friendly agent runtime.
Skills и progressive disclosure
Как подключать reusable workflows: короткий skill index сначала, полные инструкции только при необходимости.
MCP и external connectors
Как подключать внешние системы через governed connectors: namespacing, auth, permissions, audit logs и least privilege.
Security, approvals и sandboxing
Prompt injection, secrets, approval flows, draft-vs-commit, sandbox для open-world tools.
Observability и evals
Как логировать agent runs, tool calls, approvals, compactions, failures и тестировать harness на реальные failure modes.
Provider API patterns
Практики для OpenAI, Anthropic и OpenAI-compatible API без привязки к одному провайдеру.
Checklists и coverage audit
Готовые списки для проверки: перед запуском, перед добавлением tools, перед подключением skills/connectors и перед продом.
Второй сезон Атаки на Титанов на фоне первого какой-то тухленький. Даже скучнее второй арки Тетради Смерти или второго сезона Обещанный Неверленд
Буду надеяться что третий не подведёт 💪
Немного обновлений по ходу судебного дела Musk v Altman. Я частично слушаю разговоры на стриме из суда на YouTube, полностью послушал допрос Ilya Sutskever, Sam Altman и немного других членов разбирательства.
Сегодня допрашивали Sama, но удивлён, как быстро он отделался, даже не полный день. Elon сидел на трибуне несколько дней, рассказывал что как где.
У обвинения были претензии по нескольким направлениям:
— Sama постоянно врёт, все говорят, что врёт и стравливает людей. Но юристы как-то кринжово вели допрос 👨🦳 "а вот Dario Amodei говорил что вы врёте" — "а он так сказал? я не в курсе, не слышал от него" — "но вот Mira Murati говорила что вы врали ей" — "а я не слушал её показания, она так говорила?" — "простите, но у нас нет времени читать судебный транскрипт показаний". Судья даже вставила в середине специально для присяжных, что "вопросы не являются доказательствами".
— Sama владеет долями в компаниях, с которыми OpenAI ведёт бизнес. Но с его слов и со слов членов совета директоров он никогда не принимал решения и не подписывал эти договоренности, следуя законному процессу, чтобы не было конфликта интересов. Но даже при этом всём у него нет доли в OpenAI, а суммарный капитал буквально каждого второго на трибуне превышает размер его доли в компаниях. В общем, хреновый из него инвестор 😂
— самое важное: никто из опрошенных, кроме, возможно, Elon Musk (я не слушал все 3-4 дня его допроса, поэтому не могу на 100% быть уверен, что он это говорил), не говорил, что а) OpenAI обязались выкладывать в открытый доступ свои наработки б) OpenAI обремлена какими-то рамками из-за того, что взяли деньги у Elon Musk (это был взнос в НКО) в) Elon до недавнего времени что-то говорил про недовольство коммерческой частью OpenAI или системы компенсаций.
Ещё есть разного по мелочам, но напишу детали со вчерашнего допроса Ilya Sutskever:
— Когда Sama уволили, то совет директоров действительно встречался с Anthropic, чтобы предложить объединить две компании. Об этом писали в новостях ещё пару лет назад, но никакого развития событий не было. Так вот, теперь это официально. Но Dario послал :)
— Лично Ilya не был доволен потенциальным объединением, и не хотел этого
— Google предлагал ему компенсацию $6M в год, чтобы он не уходил в OpenAI. Сейчас это маленькие цифры на фоне миллиардных пакетов, но тогда было ого-го!
— Он не считает что команда Superalignment (занимающаяся AI Safety, была под руководством Ilya) была урезана в ставках на найм или вычислительных мощностях. Это ломает нарратив Elon Musk, что OpenAI забивают на свои обещания вести безопасную разработку AGI.
— Ilya отдельно подчеркнул, что он лично обсуждал с Elon Musk, что компания НЕ БУДЕТ выкладывать всё в открытый доступ. И было это ещё до 2018-го года. Почему сейчас Elon недоволен — загадка.
— Про статью Hellen Toner Ilya сказал так: он не был ей прям совсем недоволен, но это был очень деликатный топик, и что она должна была обсудить формулировки с советом директоров или хотя бы их предупредить. Ilya считал, что возможны ситуации, при которых её действия не были подходящими должности директора.
О какой статье речь? В которой Hellen упрекала OpenAI в подходе к релизу моделей и хвалила подход Anthropic. Моя рабочая версия такова, что Sama именно за неё хотел уволить Toner, поэтому соврал другому члену совета директоров для получения голоса. Ложь вскрылась, директора решили проголосовать за его увольнение, ну а дальше закрутилось-завертелось.
===
Не знаю, через сколько закончится дело и присяжные вынесут вердикт, но как я понимаю это произойдет в течение 2, край 3 недель. Основные свидетели опрошены, документы зачитаны, видео посмотрены. Как я писал, ожидаю, что Elon проиграет дело.
За сборкой очередного набора лего наконец дослушал книгу Даймонда «Ружья, микробы и сталь».
В книге Даймонд анализирует, почему одни общества — в первую очередь европейские — смогли занять настолько более доминирующее положение в мире, чем другие: народы Новой Гвинеи, племена Австралии и т.д.
Во-первых, книга безумно интересная и невероятно глубокая в своем анализе — боюсь даже представить, сколько времени автору понадобилось для сбора всей фактуры. А он писал ее в 90-е, когда не то что ChatGPT, а даже интернета в его текущем виде не было.
Во-вторых, в ней упоминается тезис, который мне самому приходил на ум каждый раз, когда я слышал утверждения о неспособности языковых моделей изобрести что-либо новое:
Технологии развиваются накопительно, а не через одиночные подвиги гениев
...
Новые технологии и материалы дают возможность получать новые технологии, комбинируя уже имеющиеся элементы
-перевод ChatGPT
Токеномика 101
В одном из чатов задавали вопрос, как трекать COGS (cost of goods sold = себестоимость) для вашего LLM сервиса
Ответ кажется супер очевидным для меня, поскольку с 2023 он не поменялся, добавились только reasoning и кешированные токены/косты. Но раз вопросы задают:
1. Нужно завести в бд таблицу token_usage:
поля, базовый минимум:
- request_id (автоинкремент)
- user_id
- input_id (на 1 запрос юзера может быть несколько api вызовов)
- tokens_in
- tokens_in_cached
- tokens_out
- tokens_out_reasoning
- cost_in
- cost_in_cached
- cost_out
- cost_out_reasoning
- model
- target (= feature, или use_case)
2. Прям в коде лежит YAML model_prices, который актуализируется ручками с выходом новой модели (цены на входе/выходе, включая кешированные)
Ждать пока цены подъедут в условный litelm мне впадлу, проще контролировать на своей стороне. Единственное каждый провайдер отдаёт количество токенов в usage через json с чуть разными ключами
UPD. Альтернативу подсказали в комментариях: models.dev
3. Логировать каждый API-вызов (не важно, успешный / неуспешный)
Логирование, понятно, нужно делать через асинхронную бекграунд таску, потому что оно не необходимо для пользователя, чтобы он получил ответ, но это все равно нужно сделать
4. Для визуализации дашбордов: self-hosted или облачные datalens/grafana/whatever
И считаешь себе когсы в любом разрезе/сегменте/периоде 🐾
Cursor выложили в открытый доступ свой набор скиллов в виде плагина к Cursor (но можно использовать и скиллы отдельно для Claude / Codex)
https://cursor.com/marketplace/cursor/cursor-team-kit
В частности, сказали самый любимый скилл их команды сейчас это
/thermo-nuclear-code-quality-review
Почему в скупе протеина 25г белка?
Второй пост из рубрики #между_ртом_и_очком. Ещё один факт о пищеварении, который я не знал раньше
Раньше я был уверен, что если просто есть необходимое для роста мышц количество белка в день, то всё заебись (обычно в рисерче фигурирует рекомендуемая цифра 1.6-2.2г белка на 1кг тела. например, для 80кг → 128г белка)
Но, закопавшись с Клодом, выяснил что суммарный рост мышц за день увеличивается не просто пропорционально количеству белка, а пропорционально количеству метаболических импульсов за день. Причем белок сверх лимита 30г, да, усваивается, но идёт уже не в рост мышц, а в восстановление органов и тканей
Мне понравилось выражение Клода, что "рост мышц – это НЕ капельница 24/7, а импульсный процесс". Происходят скорее рывки роста на короткие промежутки времени в течение суток – "метаболические импульсы" или MPS – Muscle Protein Synthesis. Эти периоды длятся 2-3 часа после приёмов пищи, в зависимости от источника белка. И вызываются, когда в организм получает "пороговую" порцию белка, 20-25г (а точнее лейцина, ~2.5г, который есть почти во всём белке в слегка разной пропорции)
Метаболический отклик – это пороговая функция, поэтому, как сказал выше, если в приёме пищи достаточно белка, импульс уже случится и величина роста мышц НЕ будет линейно зависеть от количества белка в этом приёме. Пик уже на 30г белка. Если недостаточно, отклик не случится. Протеиновый батончик, где 10-12г белка не вызовет отклик, а вот 2 батончика за присест – уже вполне
Важно, чтобы необходимое количество белка поступало единовременно, в короткий интервал времени. Если 20-25г получаются за 2 приёма пищи разделённых 30-60 минутами, MPS импульс скорее всего уже не возникнет
С другой стороны, после каждого импульса есть порядка 3-4 часов рефрактерного периода (как 20 минут у парней после секса). Если очередной приём пищи (даже с "пороговым" количеством белка произойдёт через 2-3 часа после предыдущего, новый импульс не возникнет и этот белок не засчитается в рост мышц
А какой максимум гипертрофии можно достичь за день? Сколько необходимо MPS импульсов? Ответ: 4-5. На 1 → 2 → 3 рост роста почти линейный. На 3 → 4 уже меньше. На 4 → 5 разница небольшая (те самые diminishing returns). 6 уже потребует жертвовать сном (чтобы было достаточно дистанции между приёмами пищи, а лишение себя сна отрицательно сказывается на восстановлении)
Это всё кстати и ответ на вопрос, почему у Whey протеина порции 25г белка, это необходимое и достаточное количество белка, чтобы вызвать метаболический отклик (к тому же Whey протеин – топ по кол-ву лейцина: 11-12% от белка, а эталон – сывороточный изолят: 14%)
P.S. Хорошая новость: тренировки сами по себе снижают триггерный уровень лейцина, необходимый для MPS импульса. Плохая новость: старение увеличивает (вплоть до 40г белка)
Когда нужно спавнить 10-20 субагентов для решения задачи, а когда нет?
В одном чатике ai блогеров (не ai инфобиз!) задали вопрос, кто как использует мультиагентов, у кого какой опыт – записал голосовое чтобы поделиться своей интуицией, @the_ai_architect превратил его в пост
Создатель OpenClaw умудряется тратить $1.3M токенов в Codex в месяц
https://x.com/steipete/status/2055346265869721905?s=46
Через год-два - все будут рассказывать как создавать rl environments, как сегодня учат как пользоваться Клод кодом.
Читать полностью…
Попросил Клода сообразить себе AI саппорта для Вайба. С внутренней базой знаний, изолированным tool-use, пишущий от лица саппорт-аккаунта (чтобы при эскалации продолжил человек, т.е. я), с приёмом фото/голосовых. Выгрузил ему переписки с пользователями с аккаунта саппорта, накидал пару архитектурных предпочтений
Он справился за 2 часа, пока я смотрел 3-й сезон AoT 😁
Мини кулстори: все кто сидели со мной, работали рядом ржали, когда слышали как я в клод коде стравливаю Илона Маска и Дженсена в попытках решить какую-то техническую проблему (мы же вайб кодеры, диктуем промпты голосом)
У меня есть те самые 2 killer-скилла co-design Дженсена и first principles Илона. Иногда я прошу поразмышлять над какой-то проблемой в форме дебатов между этими двумя. Бывает, они в чём-то не соглашаются, пока вдвоём копают код или данные. Бывает, в чём-то соглашаются почти мгновенно. Но чтиво всегда интересное
Вообще, полезное упражнение, в частности, привыкаешь начинать решение проблемы с удаления ненужных требований ("кто автор такого-то требования? ткните в него пальцем?"), как это делает Илон, или вопросов "а какой тут SOL - Speed Of Light? что здесь физический предел?" (в противовес рыночным бенчмаркам или твоим прошлым рекордам), как это делает Дженсен
Как тратить на LLM не 20-30% выручки, а 5-10%?
– учитесь писать харнессы
Попросил диприсёрч проанализировать слитые исходники Claude Code (OpenCode), опенсорсные OpenClaw, Hermes и других ребят – и собрал супер-мега-полезный playbook по упаковке контекста в своём агенте в виде скилла для Клода
TL;DR: это поможет вам максимизировать cache hit % и снизить себестоимость своего AI-продукта в 3-5 раз
Мини-ликбез для тех, чей CTO работает по подписке:
1) 99% LLM (включая ChatGPT, Claude, Gemini) работают на одной архитектуре - трансформеры. По умолчанию, трансформер на каждый ваш запрос пересчитывает с нуля весь промпт - системную инструкцию, всю историю разговора, ваш новый вопрос. Если в инструкции 10 000 токенов, а вы дописали 50 - она честно прогоняет вычисления по всем 10 050
2) Провайдеры поняли, придумали кеширование промпта. Если начало вашего нового запроса точно совпадает с началом предыдущего - модель не пересчитывает его заново, а берёт готовый результат из памяти. Те токены, которые "попали в кеш", стоят в 10 раз дешевле. Пример из документации OpenAI: https://developers.openai.com/api/docs/guides/prompt-caching
3) Cache hit rate – это % токенов вашего запроса, которые удалось переиспользовать из кеша. 0% – ничего не сэкономили, платите полную цену. 90% – платите ~10% от обычного. Это и есть та переменная, которая отделяет AI-продукт со здоровой экономикой от продукта, который сжигает деньги / перепродаёт токены с минимальной наценкой
4) Правило большого пальца, чтобы попадать в кеш: то, что не меняется (статическая часть) – в начало запроса, то, что меняется/дополняется каждый раз (динамическая часть) – в самый конец. Звучит банально, но 90% команд кладут в начало системной инструкции текущую дату / ID сессии / метку из аналитики / цель (либо злоупотребляют вставками/плейсхолдерами внутри промпта) – и получают 0% попадания в кеш. Каждый запрос для модели выглядит «новым», даже если отличается на 10-20 токенов где-то вначале
5) Норма для хорошо спроектированного AI-агента – 80–90% cache hit rate. Claude Code (агент от Anthropic, на котором сидят разработчики) держит 92% в проде, и команда объявляет инцидент, если показатель проседает
Внутри скилла в папке references/ покрыты все основные провайдеры: Anthropic, OpenAI, Gemini, self-hosted, OSS-agents, а также бенчмарки по индустрии
Произошёл додеп — Anthropic теперь расширили и недельный лимит на 50% (до 13-го июля, на 2 месяца).
Это в дополнение к недавнему удвоению 5-часовых лимитов.
Для фокуса, энергии и настроения я перепробовал всё — от кофе и Red Bull, до пептидов БАДов и ноотропов.
Декларирую.
Лучший энергетик — это качественный ночной сон.
Стресс-тест своей life system
Пишут про новую волну банов от Anthropic для аккаунтов из РФ (кто ходит под VPN и часто меняет регион или заходит без него)
/channel/exploitex/33504
Попросил Клода составить таблицу, что из ваших данных где хранится на случай, если с вашим аккаунтом что-то случится
Вообще рекомендую каждому себе завести в Notion (или ещё где-то) таблицу What-If с полным stress-test вашей жизни
• Что если тебя уволят
• Что если уволится сотрудник X
• Что если потеряешь телефон
• Что если потеряешь SIM-ку
• Что если твою почту взломают
• Что если потеряешь MacBook
• Что если забанит Anthropic
• и т.д.
Всегда полезно заранее продумать хотя бы черновой "план Б" на разные подобные сценарии. Фоллбеки, а также фоллбеки на фоллбеки