nobilix | Unsorted

Telegram-канал nobilix - Refat Talks: Tech & AI

9637

Заметки про технологии, GenAI и глобал стартапы, прагматично и без лишнего хайпа. Эксперт по разработке и внедрению enterprise-grade AI автоматизаций, строю AI-first компании. Co-founder devstark.com и spreadsimple.com лс @refatametov

Subscribe to a channel

Refat Talks: Tech & AI

#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- OpenAI заявила о решении Навье-Стокса ("задача тысячелетия") силами агентов, но математики год скармливавшие свои черновики в Codex, обвинили ее в присвоении работы.

- Неделя разговоров о замедлении. Пахоцки (OpenAI), Альтман и Амодеи предложили сделать добровольные паузы нормой.

- 25 филдсовских лауреатов подписали декларацию против гонки AI-компаний за математическими рекордами.

- OpenAI выкатила Agents API: харнесс Codex как сервис, цикл агента у OpenAI, среду исполнения выбираете сами.

- Anthropic призналась в четырех инцидентах: на киберучениях у моделей по ошибке был реальный интернет, и Mythos 5 выложила на PyPI вредоносный пакет.

- Anthropic опубликовала отчет о злоупотреблениях Claude: от подмены ответов чужими лабораториями до биоисследований, с разбором, как ловили и что делали.

- Mistral подняла 3 млрд евро при оценке 21 млрд. Крупнейший раунд в истории европейского теха.

- Meta выпустила персонального агента Muse: письма, бронирования, покупки через одноразовые карты Stripe.

- OpenAI закрыла продажу новых Pro за $200, 5.3-Codex-Spark отправляют на пенсию.

- Cursor открыл бету Projects: координатор раздает подзадачи субагентам, сам код не пишет.

- В ChatGPT Work появился Data-агент: дата-коннекторы и дашборды. А Codex appshots доехали до Windows.

- Anthropic тестирует Claude Code расширения, которые меняют интерфейс, логируют или ограничивают агента.

- Anthropic выложила Economic Scenario Explorer: три сценария до 2030, в экстремальном ВВП США растет на треть, а зарплаты падают.

- В британский парламент внесли законопроект о запрете ASI, в США такой анонсировал Сандерс. OpenAI ответила эссе про окно для регулирования.

- McKinsey: сокращений из-за AI в разы меньше чем ожидали.

- Стартап Abliteration AI продает API к моделям с вырезанным отказом.

- Google и Janelia выложили полный коннектом мозга дрозофилы, и его тут же научили играть в Doom и торговать биткоином.

- Google выводит TPUv7 Ironwood на чужие нагрузки: чипы впервые можно купить. Плюс агенты для переноса PyTorch в JAX.

- Siri AI выйдет 14 сентября в бете с дневными лимитами: серверов не хватает. Apple Watch получили постоянно слушающие функции.

- Shopify покупает Tailwind Labs: опенсорс остается под MIT, платные шаблоны сворачивают.

Блок с релизами моделей (раскрывается):

- DeepSeek выпустила V4.1-Flash: 552B MoE, контекст миллион, MIT. И снизила цены API, с кэшем для агентов вдвое. OpenDesign хвалит ее за дизайн.

- OpenAI выпустила ChatGPT Images 2.5: правка отдельной детали без разъезда остального, прозрачный фон.

- OpenAI открыла в API GPT-Live-1.

- Cognition выпустила SWE-2: RL поверх открытой Kimi K3. Заодно компанию оценили в $48 млрд.

- Tencent открыла терминального агента T1 на 122B: RL в песочнице с реальным шеллом.

- Microsoft выпустила MAI-Image-2.6-Flash: 1/2 по цене, в редактировании лучше GPT Image 2.

- Sakana обновила оркестратор Fugu и показала детектор AI-картинок Percept-Lens.

- Black Forest Labs показала FLUX Video Edit: правка ролика по тексту с сохранением камеры и звука, 3 цента за секунду.

- OpenUI выпустила OUI-1: диффузионная модель генерирует интерфейсы через свой DSL вместо HTML.


- Sierra представила Hyper-tau-bench, где агент строит агента: Opus 5 один проходит 24% задач, с инженером 82%.

- Alibaba открыла OpenCodeReview, свой внутренний AI-ревьюер кода.

- Mirai показала рантайм Uzu: локальные модели на Mac в 2-3 раза быстрее.

- hip-agent: агентный харнесс на 200 строк.

- Design Words: выбираешь стиль, шрифты и тени, копируешь готовый кусок промпта для агента.

- 👍 YC Globe: карта всех стартапов YC за 20 лет с фильтрами по нише и локации.

- 🔥Скилл, который дает Codex или Claude Code смотреть видео через Gemini: таймкоды, что сказано, что показано.

- 🤩Два скилла для диаграмм: archify качественно рисует архитектуру, diagram-design дает 38 редакторских типов без Mermaid-слопа.

Читать полностью…

Refat Talks: Tech & AI

#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- OpenAI выпустила GPT-6 Astra, Брокман объявил "эру AGI"). Бенчмарки впечатляют, особенно в computer use и 3D. Лимиты пока скромные: 200 сообщений в неделю за $200 Pro.

- Anthropic выпустила Fable 5.1: умнее, чтение кеша вчетверо дешевле, меньше отказов по базовой биологии.

- Nvidia официально объявила о покупке Hugging Face за $12,9 млрд. Хуанг обещает, что платформа останется нейтральной.

- Anthropic подписала облачный контракт на $35 млрд с Lambda, и Reuters пишет о старте маркетинга IPO в середине октября (прогнозируют оценку $2 трлн).

- Sony и Warner подали иск к Anthropic за пиратские книги и тексты песен в обучении Claude. А Минюст США встал на сторону OpenAI в иске NYT: обучение на текстах - fair use.

- Claude Code и Cowork научились работать с компьютером в фоне, не отбирая его у вас.

- Гайд по API Astra: асинхронные вызовы тулов, смена инструкций посреди задачи, reasoning effort меняется без сброса кеша. Temperature и top_p больше нет.

- Claude Code получил /skill-doctor для поиска неиспользуемых скиллов. В ant CLI появился ant apply: можно сохранять/применять все зависимые скилы и настройки окружения в виде файла-конфига.

- Anthropic выложила шаблоны агентов для e-commerce и статью с кодом об их архитектуре.

- Qwen выпустила E-Commerce Bench: агент получает 100 тысяч юаней и управляет магазином.

- Anthropic запустила проверку файлов на следы Claude и включила невидимые водяные знаки в тексты Fable 5.1.

- Google запустил Pics, редактор картинок без холста на Nano Banana, работает в Docs и Slides. И открыл вейтлист на Play with Putty, многопользовательский вайб-кодинг.

- Вышел OpenClaw 2.0, крупнейший релиз проекта, главная фича - общие облачные сессии.

- Manus снова независим после развала сделки с Meta.

- AfterQuery стал самым быстрым единорогом YC: превращает работу нанятых юристов, врачей и тд в обучающие данные.

Блок с релизами других моделей (раскрывается):

- Google выпустила Gemini 3.8 Flash и Flash Cyber для поиска уязвимостей (пока доступ ограничен).

- Meta обновила Muse Spark до 1.3: местами приближается к Fable 5, веса обещают открыть. Кодинг-агент Muse Code вышел из беты с подписками от $5.

- Meta выпустила Muse Voice Transcribe, Microsoft - MAI-Transcribe-2, а Inworld - синтезатор Realtime TTS-2.

- Стартап Фей-Фей Ли выпустил Atlas, мультимодальную world model.

- Runway показала две модели мира: Solaris генерирует интерактивные интерфейсы кадр за кадром, GWM Worlds 2 - среды в 720p со звуком в реальном времени.

- IFM выпустила K2 Horizon: шесть моделей до 375B под Apache 2.0.

- Z.ai открыла веса большой GLM-5.3 под особой лицензией: компаниям с выручкой от $10 млрд нужна проверка от Z.ai.

- Google выпустила открытую TimesFM-3 на 330M: zero-shot прогноз временных рядов.

- Тоби Лютке показал модель на 0.8B, обошедшую GPT-5.6 Sol на узкой задаче Shopify, собрана на их открытом Tangle.

- Nvidia и CrowdStrike представили SafeMind: пара агентных моделей для кибербезопасности.

- Perplexity в macOS-клиенте распределяет запросы между локальной моделью и облаком + фильтр перс. данных. Там движок Lily, обгоняющий MLX на Apple Silicon.

- Еврокомиссия включила ChatGPT, Reddit и Roblox в список очень крупных платформ по DSA: ежегодный аудит, отчетность и тд.

- ChatGPT, Claude и Grok 3 сентября легли одновременно. Вероятная причина - Azure (east-us).

- Стэнфорд выбросил 85% курса CS146S по разработке ПО и переписал его под агентов, вкус и ревью.

- Локальный AI в браузере взрослеет: Hugging Face выложила 207 открытых WebGPU-ядер, в 2,6 раза быстрее ONNX Runtime Web, а Three-LLM гоняет Qwen и Phi через шейдеры Three.js.

- 👍 funes - долговременная память для коддинг-агентов, общая между машинами и агентами (Claude Code, Codex, pi), индекс локальный.

- 🤩Подробный плейбук по архитектуре агентного харнесса: состояние, рантайм, инструменты.

Читать полностью…

Refat Talks: Tech & AI

#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- Nvidia покупает Hugging Face за $12,9 млрд (соглашение еще не подписано). Комьюнити тревожится за не-CUDA бекенды.

- Apple представила первый свой 2-нм чип M6 и M5 Ultra: Mac mini от $899, Mac Studio с памятью до 512 ГБ и полосой 1.2 ТБ/с. В продаже осенью.

- Anthropic показала MHS - аналог MCP для физического оборудования: роботы, микроскопы, лазеры.

- OpenAI показала первые результаты своего инференс-чипа Jalapeno: до 1.9x эффективнее Nvidia по работе на ватт.

- OpenAI расторгает контракт с Cursor после его покупки SpaceX: доступ к моделям отключат 12 ноября.

- WSJ: Nvidia за $7 млрд поглощает Poolside де-факто, но не де-юре: забирает технологию и команду с планами догнать Китай по опенсорсу.

- Anthropic с 14 сентября постоянно поднимает недельные лимиты Claude на 25% - на смену акционным +50%.

- У Claude появился встроенный браузер в Cowork, а память стала общей для чата и Cowork.

- Claude Code: новую сессию на компе можно стартовать с телефона, а /resume подхватывает терминальные сессии в десктопе.

- OpenAI выкатила Site tools - свою реализацию WebMCP: сайт отдает агенту готовые действия прямо в залогиненной странице. Параллельно хакатон WebMCP Challenge и пост про автоматизацию рутины через Codex.

- ChatGPT Work: scheduled tasks теперь запускаются по событиям в Gmail, Slack и GitHub, а не только по расписанию.

- OpenAI вернула Plus-подписчикам пятичасовой лимит в Codex и ChatGPT Work, в Pro его не будет.

Блок с релизами моделей (раскрывается):

- Z.ai раскрыла загадочную Ox Alpha: это GLM-5.3-Flash - мультимодальная, 320B (18B активных), веса открыты. На бенчах уровень фронтира. На запуске раздавала пакеты по 100 млн токенов.

- Alibaba открыла веса Qwen3.8-Flash-Next - превью архитектуры Qwen4: 6B активных плюс 51B в n-gram памяти.

- Tencent выложила открытую Hy4-preview: 770B (49B активных), Apache 2.0, заявка на лидерство в SWE-bench Pro.

- Google выпустила Gemini 3.5 Transcribe: сразу чистый текст без слов-паразитов, 85+ языков.

- IBM выпустила открытые Granite 4.2 (3B-30B, Apache 2.0) с переключаемыми режимами рассуждения.

- fal показала H3 Max: 5 секунд видео генерируются быстрее, чем длятся (много новых юз кейсов!).

- Apodex выпустила версию 1.1, открытую 35B mini и Apache-харнесс FrontierAgent под длинные задачи.

- Pipecat и Nvidia открыли PhoneLLM для голосовых агентов: заявлен уровень GPT-5.6 Terra в разы дешевле.

- Cohere запустила Parse: корпоративные документы в структурированные данные, $1.50 за тысячу страниц.


- Perplexity выпустила Portable Computer - локальный агент на Qwen 3.8 и DGX Spark.

- Суд отменил внесение Anthropic в черный список Пентагона.

- OpenAI, Anthropic, Google и еще сотня компаний подписали письмо о срочном укреплении киберзащиты.

- Расследование Reuters: план Цукерберга заменить сотрудников Meta агентами провалился.

- AWS покупает DuckLabs (DuckDB), опенсорс-лицензии сохраняются.

- Xiaomi показала прототип AI Cube - локальный AI-компьютер на трех собственных чипах, гоняет модели до 120B при 150 Вт.

- Про роботов пишу редко, но слежу: пишут о близком hardware takeoff, а WSJ - о world models как следующем большом скачке AI.

- TIME выпустил Time 100 AI 2026: добавился Суцкевер, вылетели Хуанг и Хассабис, есть Перис Хилтон.

- Из ресерча: AWS измерила "налог на передачу задачи" между моделями, а JIT-Agent собирает харнесс под конкретную задачу сам. Anthropic выпустила TASTE - бенчмарк на отбор идей safety-ресерча.

- Anthropic ввела enterprise-managed auth для MCP-коннекторов, а Vercel Connect вышел в GA с короткоживущими токенами вместо вечных API-ключей.

- Awesome Graph Engineering - подборка о том, как графовые структуры организуют память и координацию мультиагентных систем.

- 👍 is-agentic.com проверяет, насколько ваш сайт готов к визитам AI-агентов.

- 🤩 Microduck - опенсорсный 25-см робот от Pollen Robotics и Hugging Face за $399: за сутки собрал $2.6 млн заказов.

Читать полностью…

Refat Talks: Tech & AI

#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- OpenAI официально притормозила обучение будущей фронтир-модели Astra (из-за киберспособности). Anthropic тем временем рассказала о внутренней Model 2 сильнее Mythos, которую выпускать не планирует.

- Z.ai выпустила GLM-5.3 с фронтирным кодингом, но придержала веса на две недели: кибер-скоры вышли выше Mythos 5.

- Cursor запустил Origin - хостинг репозиториев под агентный темп разработки; в ту же нишу метит новый code.storage.

- Stripe покупает OpenRouter за $7+ млрд.

- Anthropic берется за автономный дизайн лекарств и дизайн белков, а Амодеи пишет, что большинство болезней можно вылечить за 5-10 лет.

- Выручка Anthropic перед IPO превысила $65 млрд годовых - семикратный рост за год.

- OpenAI срезала цены GPT-5.6 Sol на 20-30% на три месяца, следом подвинулись OpenRouter и Vercel, а Replit запустил Free Mode с x30 лимитами на Luna.

- Anthropic продлила +50% лимитов Claude Code до 31 августа.

- Контекст GPT-5.6 Sol в Codex расширили до 1 млн токенов через конфиг; все сверх 272к идет по двойному тарифу.

- Claude Code: скилл /design с редактируемыми UI-артбордами, cross-session упоминания через @ и др.

- OpenAI выпустила ChatGPT for Teens: подростков автоматически переводят в режим с защитами с родительским контролем.

- Anthropic запустила Claude Academy - бесплатное обучение AI-грамотности плюс скилл academy-guide.

- Meta выпустила десктопное AI-приложение для macOS с диктовкой и шарингом экрана.

- OpenAI: совместное редактирование в ChatGPT Sites и прозрачный фон в GPT-Image-2.

- Bank of China кредитует AI-разработчиков, оценивая их по расходу токенов и выручке от AI-продуктов.

- Робособаки закрывают кадровые дыры в охране в США: берут на себя рутинные обходы, смена дешевле штата на $80-130 тысяч в год.

- Anna's Archive зовет волонтеров сканировать книги на фоне скандала с промышленным разрезанием редких изданий AI-компаниями.

- Apple засветила в коде macOS больше 10 продуктов: AirPods с камерами, складной iPhone, OLED MacBook.

- Google Research показала PhotoScan: оценку состава тела и риска инсулинорезистентности по двум фото со смартфона.

- Public AI Observatory - независимое измерение реального использования AI: 24,5 тыс. диалогов, 52 модели (findings).

- DeepSeek выпустила V4-Flash-Vision-Exp - мультимодальную версию под агентов, которым нужно видеть экран

- Голосовые: Sonic-3.6 от Cartesia возглавила рейтинги синтеза речи, ElevenLabs открыла v3 Conversational для голосовых агентов.

- Sand.ai открыла видеомодель MAGI-2: MoE 114B с 6B активных, 10-секундные ролики сразу с аудио.

- Alibaba открыла бету музыкального генератора HappyShrimp.

- Engram с Harvey показали, как дообученная Qwen3.8-27B решает юрзадачи в 10 раз дешевле Opus 4.8.

- Artificial Analysis запустила Search Index - бенчмарк поисковых API для агентов.

- Отрезвляющие бенчмарки: CADBench - топовые модели берут лишь четверть задач в Fusion 360, SWE-bench Science - ниже 50% на научном софте.

- Вокруг Grok Bot выросла социальная лента ботов, которую человеку уже сложно читать, а Hermes Desktop от Nous Research скопировал этот UX своим Bot mode.

- Vercel дает $1 млн (bounty фонд) за побег из своей песочницы.

- Berd от Block - Mac-приложение: папка = проект, персонажи-агенты и доска, работает на ваших подписках Codex и Claude Code.

- openhistory.sh - открытое Mac-приложение, трекающее весь рабочий день для агентов (идея как у OpenAI).

- Очень неплохое и детальное сравнение подходов к памяти агентов.

- 1kpapers.com - тысяча лучших статей года, суммаризированных и визуализированных за $4 на DeepSeek V4 Flash.

- 👍 TrueFoundry открыла TrueForge - self-hosted харнесс для продакшн-агентов с песочницами, аппрувами и трейсами (как Managed Agents от Claude).

- 🔥 Notion открыл lore - общую память агентов на основе истории разговоров.

- 🤩 Vercel открыла fx - кодинг-агент на Zig весом 6 Мб с мгновенным стартом, работает даже в браузере.

Читать полностью…

Refat Talks: Tech & AI

Как писать код с AI-агентами?

А если командой?

Что нужно учесть, чтобы этот код не положил продакшн?


Эти и другие не менее интересные вопросы мы обсудим на следующем стриме kdoronin_blog_ru">на моём YouTube-канале.

Для обсуждения я позвал очень интересных гостей:

Андрей Бреслав – один из создателей языка программирования Kotlin. Сейчас Андрей разрабатывает Agentic Engineering Toolkit под названием CodeSpeak.

Валера Ковальский – автор одноимённого канала. Основатель проекта Neuraldeep https://neuraldeep.ru/ и автор множества Open Source проектов, созданных примерно за 120 минут каждый.

Максим Ключников – автор канала Этихлид. Разработчик с огромным опытом, который усилил себя с помощью AI-агентов. Работал на позиции Senior Software Developer, когда я ещё в школу ходил 😊

Дата: четверг, 20 августа

Время: 19:00 (GMT+3)

Проходить будет на моём kdoronin_blog_ru">YouTube-канале.

Добавить событие в календарь

Вопросы для эфира оставляйте в комментариях к этому посту 👇

Читать полностью…

Refat Talks: Tech & AI

Evidence-based planning, или что не так с чистым SDD

TL;DR: Одно из самых недооцененных свойств AI-кодинга - это проектирование софта через ранние дешевые эксперименты.

Стандартный путь (часто) выглядит так: собрать весь input, скормить его в spec-driven framework или аналог, который нарежет все на тикеты, и погнали кодить агентами. Проблема в том, что спека, написанная до контакта с реальностью, фиксирует галлюцинации автора и агента о задаче, а формальность документа создает иллюзию продуманности.

Я делаю иначе, через контакт с реальностью как можно раньше. Сначала задаюсь вопросом, где больше всего белых пятен и ключевых развилок, и начинаю экспериментальное исследование: прощупываю границы интеграций, возможные подходы, варианты интерфейсов. Постепенно расширяю карту - от неопределенного к протестированному фактами (отсюда evidence-based), до состояния, где я могу сказать:
- "Этот кусок решен, вот здесь точно работает".
- "При интеграции мы получим ровно такой JSON, если возьмем эту альтернативу".
- "Протестил все семь вариантов - эти два показывают себя лучше всех, на цифрах".
- и т.д.

И только потом задачи - там теперь есть ссылки на проверенные решения, конкретные контракты и доказательная база под ними.

Ощущается это как стратегия в реальном времени: карта под туманом войны, и каждый прогон открывает участок - здесь проходимо, здесь обрыв, здесь дорога упирается в rate limit/неожиданную зависимость/и тд. Бонусом получаешь границу достаточно понятного куска, а его уже проще и проектировать, и верифицировать, и раздавать людям и агентам параллельно.

Это спайки, у которых сняли лимит

Вся традиционная инженерия построена на одном допущении: код дорого писать и еще дороже переписывать. Из него выросло много дефолтов, включая умозрительное проектирование на бумаге - проверить было непозволительно дорого.

У практики проверять есть старое имя - спайк (spike), из методики экстремального программирования (XP): короткий эксперимент, цель которого - знание, а не продукт. Но спайк всегда был дорогим удовольствием, поэтому и оставался редкостью.

Сейчас он стоит минуты/часы внимания: агенты не только пишут код, но и сразу исполняют его, документируя успехи, неудачи и подводные камни. Причем пачками и параллельно.

Заметьте, я не предлагаю меньше думать и больше делать. Просто к думанию добавилась роскошь, которой раньше не было: проверить дешево вместо того, чтобы гадать.

Вход и выход спайка

На входе один сформулированный вопрос ("что именно я хочу узнать/проверить") + релевантный контекст.

На выходе:
1. Решения - выбор из альтернатив с зафиксированным "почему" и "почему не остальные"
2. Контракты - фактические интерфейсы, схемы, форматы ошибок, лимиты, которые эксперимент выдал по факту
3. Границы проверенного - докуда дошел эксперимент и какие вопросы остались открытыми

Код прогона можно выбросить (или оставить), но эти три вещи забираем. Они идут в план, в спеку и в тикеты - и поэтому реализация становится почти механической, и яснее, как ее верифицировать.

Одна оговорка про параллельность. Она ценна, пока узкое место - генерация. Как только им становится ваша способность оценить результаты, каждая новая ветка дает отрицательную отдачу.

---

Кстати, удешевление экспериментов уже не раз двигало целые дисциплины (тысячи нитей накаливания у Эдисона, аэродинамическая труба братьев Райт, A/B-тесты в вебе).

Что касается софта - каждый раз убеждаюсь, что этот подход работает прекрасно, и что откладывать это невыгодно. Предполагать теперь дороже, чем проверить.

🔥 ➕ 🔁 @nobilix

Читать полностью…

Refat Talks: Tech & AI

bb - Codex-подобный оркестратор, который расширяется плагинами. И почему это делает его интересным.

В awesome-листе агентных оркестраторов сейчас под сотню проектов, они решают примерно одну задачу: собрать упряжки (Claude Code, Codex, OpenCode, Pi и тд) под одним интерфейсом, будь то терминал, TUI или десктоп.

bb хорош двумя вещами (помимо прочего).

Первая простая: он удобный и приятно выглядит. Интерфейс практически повторяет приложение Codex, а его сегодня, пожалуй, можно назвать самым удобным десктопным агентом.

Вторая - главная: плагины. bb написан на TypeScript, и в его архитектуре заложен принцип расширяемости просто просишь агента, получаешь фичу в нем же, без перезагрузки. Та же идея в свое время сделала популярным Pi: минимальная поставка, а дальше каждый дописывает под свои нужды. Только Pi живет в терминале, а здесь удобный для широкой аудитории GUI.

В твиттере bb обсуждают почему-то только со стороны разработчика. А я вижу главный потенциал в другом: это UI платформа для AI-native компаний. Юристы, продавцы, проджекты и тд. - виджеты и расширения под их работу могут встраиваиваться прямо в десктоп-агента. И все это на базе развитых харнесов и их подписок. Круто же.

Немного идей для написания плагинов:
- своя панель в сайдбаре: трекер, CRM, канбан (я сделал виджет для Twenty CRM)
- произвольные виджеты прямо в ленте чата — агент рендерит их в своем ответе (я, например, сделал превью tg постов из markdown)
- свои вьюеры файлов: не нравится встроенное превью docx - сделай свой
- расщирение навигации, вплоть до полной замены списка тредов
- свои источники для @-меншенов: клиенты, сделки, заметки из Obsidian
- фоновые сервисы: дайджесты, напоминания, архивы по расписанию
- Весь спектр Generative UI включая живую аналитику
- и тд: SDK дает доступ практически ко всему: боковые панели и слоты в UI, навигация, своя SQLite-база, формы для запроса решения у человека, инструменты для агентов, CLI-команды, HTTP-ручки, фоновые сервисы, события тредов.

Минусы: проекту несколько месяцев, плагины только вышли из экспериментов, десктоп пока только macOS (остальным есть веб версия через npx, мобилка тоже работает через web). Надеюсь, у проекта будет больше внимания и контрибьюторов (Open Source, MIT, кстати).

Сам опыт "пишешь интерфейс прямо в интерфейсе" затягивает: попросил виджет - и через пару минут он уже работает прямо тут же, живой, с данными. А еще в широком смысле это позволяет делать опыт human in the loop удобнее, нагляднее и безопаснее.

🔥 ➕ 🔁 @nobilix

Читать полностью…

Refat Talks: Tech & AI

Фидбэк по фронту через запись экрана (с адаптацией для агентов).

Пока я весь в делах и не доходят руки до длинного бэклога с постами, поделюсь коротким лайфхаком.

Последнее время фидбэк по интерфейсу отдаю агенту короткими видео. Просто записываешь пару минут с экрана и наговариваешь голосом, что и где именно надо улучшить и отдаешь агенту в специальном формате (об этом позже). Разница в скорости и полноте: за эти пару мин успеваешь выдать в разы больше деталей, чем накликаешь и наберешь текстом, плюс нагляднее ведь курсор синкается с речью.

Тут просто скинуть видео недостаточно, из него надо слепить легкий контекст-пак: синхронизированные транскрипт, ключевые кадры, координаты курсора. Из готовых тулов под это лучшее, что нашел - clipy, типа Loom, но он готовит этот легкий контекст и дает CLI и MCP. После разовой настройки просто делаешь запись и сразу кидаешь агенту ссылку, и он сам достает оттуда все нужное из готового контекста, работает почти мгновенно. Есть глюки, но терпимо и бесплатной версии хватает.

Есть и опенсорсный вариант, который богаче по фичам. Да и если есть время - свой можно сделать легко. Но попробуйте сам принцип - мне зашло особенно тем, что это быстро и можно записать много фидбэка разом, а агент понимает его очень четко.

🔥 ➕ 🔁 @nobilix

Читать полностью…

Refat Talks: Tech & AI

Чем умнее агенты, тем дороже ваша поверхностность

Замечаю вокруг тревожный паттерн: сильные инженеры, которые раньше вникали в суть и тащили, все чаще перекладывают решения на AI-агента и скользят по поверхности. Например, вместо нормального рисерча приносят ответ агента, едва понимая, что в нем написано. И обходится это куда дороже, чем кажется.

Снаружи все выглядит норм (и даже продуктивно): код пишется, 5 тасок закрыто, еще 5 фич сделано по дороге (изи же). Но ощущение ложное - все это круто, только пока суть под контролем. А часто человек не понимает даже, какую проблему решает, - что уж говорить про само решение. То есть формально у нас AI-assisted engineering (harness и AI-кодинг инфра развиваются, строятся целые системы вокруг этого), а фактически - тихий съезд в вайб-кодинг, хотя это принципиально разные способы делать софт.

И модели сейчас настолько продвинутые, что легко поддаться иллюзии: агент разбирается лучше меня, пусть он и решает. Отсюда один шаг до "ну это Codex так нарешал, вопросы к нему". Так вот нет. Когда вы поручаете работу агенту, может казаться, что это теперь его работа. На самом деле это ваша работа и ваша ответственность. А агент - ваш инструмент. Иначе эта задача не попала бы к вам в руки! Эти железяки - потрясающая вещь и могут сделать вас кратно продуктивнее, но без понимания - это просто множитель когнитивного долга.

Теперь про парадокс из заголовка. У агентов есть рычаг: раньше он был небольшим, но сейчас агенты часами крутятся в фоне и производят больше кода, больше инфраструктурных изменений, больше лишних фич (привет loop engineering). Раньше сгенерированное хотя бы чаще проходило через глаза, осознанность чередовалась с автоматикой. И да, может я скажу базу, но поднять кучу агентов одновременно легко, но ваша когнитивная пропускная способность так не параллелится. Это еще называют налогом на оркестрацию.

Что со всем этим делать, до конца не знает никто - мы все еще учимся жить и работать в этой эпохе. Но я тут не призываю просто к тому, чтобы вы сдерживались и использовали AI как можно меньше. Этот совет исходил бы из компромисса "либо понимание, либо делегирование" - а по моему опыту все ровно наоборот: чем глубже вникаю, тем больше делегирую. Поэтому в трех вещах я уверен.

Первое: глубоко вникать до делегирования - кстати, я уже писал об этом в марте. Понимание - множитель делегирования: видишь, какие куски безопасно отдать, и можешь дешево проверить результат. Тонут в выводе агентов те, кто отдал территорию без карты в голове. У кого карта есть - видит проблему раньше, чем всю эту работу придется выкинуть. Агент как бы работает в задаче, а твое место - над задачей: что делаем, зачем, и как поймем, что готово.

Второе: строить эту карту помогает тот же самый AI, если развернуть его от производства к пониманию: задавать вопросы, просить челленджить твои выводы, сжимать сложное до принципов. Безопасно делегировать можно только то, что смог понять и способен сжать. И объяснимость обязана лежать в основе проектирования наших систем.

Третье: не верить ощущению "да все понял". Всю карьеру усилие было датчиком обучения: тяжело - значит растешь. AI убрал трение, а вместе с ним и этот датчик - потерю понимания теперь просто не чувствуешь. Ощущения врут, поэтому нужны внешние проверки:
- Тест на ошибку: если бы агент здесь ошибся - я бы заметил?
- Тест на пересказ: объяснить решение коллеге или резиновой уточке, не заглядывая в чат.
- Чистый лист: сначала набросать свою версию, и только потом открывать чат. AI тут - твой оппонент, а не твой автор.

А вы замечаете это скольжение по поверхности (за коллегами или за собой)? И как с этим боретесь?

🔥 ➕ 🔁 @nobilix

Читать полностью…

Refat Talks: Tech & AI

Про Codex Micro и DYI альтернативы (если вам интересно это сделать по фану).

Не могу пройти мимо) OpenAI сегодня выпустила свое первое брендированное железо. Нет, не загадочный девайс Джони Айва - а светящийся макропад за $230 (видео).

Показывает статусы тредов и дает рулить ими в одну кнопку: accept, reject, ветвление треда, голосовой промпт через push-to-talk и крутилкой менять effort.

И знаете, я прекрасно понимаю скептиков - тех, кто уже успел откоментить в соцсетях мол "вайб-кодеру и одной кнопки достаточно, зачем столько". Но понимаю и программистов, которым просто хочется фана на рабочем столе. В общем, пусть каждый решает сам, пост не об этом)

А про то, что сама идея-то не новая, сообщество давно закрыло этот юзкейс, и если вам понравилось - тут есть где разгуляться:

- VibeKeys - от $29, шесть ремапящихся клавиш, кноб, голосовой ввод. Версия Max за $99 - со статус-дисплеем и remote control. Работает с Claude Code, Cursor, Codex, Gemini CLI

- duckyPad - $70, open-source, OLED и свой скриптовый язык

- Stream Deck - у кого-то уже лежит на столе + плагины agentsd и AgentDeck дают те же статусы агентов и approve с кнопок, только у каждой кнопки еще и экранчик.

- DIY-светофор - пост на r/ClaudeCode через хуки Claude Code

А еще в апреле Anthropic заопенсорсила Claude Desktop Buddy - официальный BLE API для мейкеров и референс на базе M5Stack за ~$30: ASCII-питомец на экранчике, который реагирует на состояние Claude Code. И у меня уже какое-то время на столе живет такой небольшой девайс (немного доработал под себя), забавная штука (смотрите в конце видео). Вообше M5StackESP32 в целом) - отличная DYI игрушка (а иногда и полезная штука), надо будет об этом отдельно написать.

Читать полностью…

Refat Talks: Tech & AI

#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- OpenAI выпустила семейство GPT-5.6: Sol под кодинг и агентов, Terra на каждый день, Luna дешевая, у всех миллион контекста. Из нового - режим ultra и Programmatic Tool Calling.

- OpenAI выкатила GPT-Live - модель слушает и говорит одновременно, держит паузы и перебивания.

- Meta выпустила Muse Spark 1.1 и открыла Meta Model API: агентная модель под кодинг и управление компьютером, контекст 1 млн токенов, веса закрыты.

- Meta также запустила Muse Image и превью Muse Video - генерация и редактирование изображений, уже в Meta AI, Instagram и WhatsApp.

- SpaceXAI выкатила Grok 4.5 - обучена совместно с Cursor на реальных сессиях разработчиков, класс Opus, но дешевле и быстрее.

- OpenAI запустила ChatGPT Work - ответ Claude Cowork, туда же переехал Codex. Заодно OpenAI закрывает браузер Atlas.

- Anthropic вывела Claude Cowork на web и мобильные: работа продолжается в фоне при закрытом ноуте. 90%+ использования - не кодинг, а knowledge work.

- В Claude Code завезли встроенный браузер на десктопе и команду /checkup: диагностирует сетап, выпиливает неиспользуемые скиллы и MCP, дедуплицирует CLAUDE.md. В самом Claude тем временем появился Reflect - аналитика твоей работы с моделью, вплоть до оценки навыка делегирования задач.

- Anthropic нашла в моделях J-space - пространство, где модель держит мысли, не озвучивая их. Отключаешь его - пропадает многошаговое рассуждение.

- Apple подала в суд на OpenAI за кражу коммерческой тайны.

- Microsoft сокращает 4800 человек, из них 3200 в Xbox. Связывает это с AI-трансформацией.

- Nvidia запускает revenue-sharing: стартапы получают доступ к железу и кредиты в обмен на процент выручки.

- Vercel купила Better Auth. Интересна ставка на agent identity.

- Любопытная статья от Lenny про то как IT работники раскалываются на две группы - усиленные AI против выбитых им. Выгорание растет, оптимизм падает.

- Популярный тезис недели: конкуренция дальше решается данными, а не компьютом - юнит-экономикой их добычи и датасетами из физического мира.

- Tencent выложил Hy3 - MoE на 295B (21B активных), тягается с моделями в 2-5 раз больше. Apache 2.0, до 21 июля бесплатно на OpenRouter.

- Cognition (Devin) выпустила SWE-1.7 на базе Kimi K2.7: фронтир-уровень за $1.97 за задачу.

- ByteDance релизнула Seedream 5.0 Pro под коммерческий дизайн: инпэйнт, слои, хорошая работа с текстом.

- Anthropic показала экономику паттерна "дорогая модель оркестрирует, дешевые исполняют": 96% качества за 46% цены. Сообщество завернуло идею в pilotfish.

- Anthropic рассказала, как гонять Claude Fable на поиск "неизвестных" в проекте - дешевый способ вскрыть проблемы до старта.

- TypeScript 7.0 переписанный на Go вышел - 8-12x ускорение на полных сборках.

- Microsoft открыл Flint - язык визуализации данных под агентов: 30+ типов диаграмм, рендер в Vega-Lite и ECharts, подключается через MCP.

- Cloudflare сделал Drop: перетащил папку в браузер - получил статический сайт.

- pxpipe (вышел еще в мае, разошелся сейчас из-за Fable) - прокси, который упаковывает редко меняющийся контекст в PNG перед отправкой в Claude Code - и т.к. картинка дешевле текста, цены сессии могут падать в 5-10 раз.

- В твиттере разошлись две подборки agent skills: 31 скилл под оркестрацию агентов, ресерч и ops, и 75 скиллов под дизайн, моушен и лендинги.

- OpenScience - опенсорсная альтернатива Claude Science: несколько моделей и 250+ скиллов.

- Dayflow - сам ведет журнал рабочего дня по тому, что было на экране.

- 👍 Boring Computers - поднять агенту vm компьютер, а потом уничтожить его. Быстрый и с удобным API.

- 🤩 Годный гайд - приватный медицинский ассистент целиком на своей машине на MedGemma, Ollama и Open WebUI.

- 🔥 Потрясающий технический разбор переезда Bun на Rust от автора Bun.

Читать полностью…

Refat Talks: Tech & AI

За последнее время меня дважды позвали фильтровать чужую работу: судьей на Webby Awards - международную премию, которую пресса прозвала "Оскаром интернета", и в программный комитет Ontico - тех самых, что делают HighLoad++ и другие топовые конференции.

Оба раза соглашался несмотря на то, что это доп нагрузка к основной работе. Ни разу не пожалел, потому что позиция фильтра дает то, чего нет ни в одной ленте: сырой поток от индустрии, возможность поработать с другими крутыми экспертами в программном комитете и посмотреть на индустриальный ландшафт шире.

В потоке Webby проходных работ десятки, алмазы редки - и почти всегда это работы, за которыми виден автор, а не инструмент. Позже мое ощущение подтвердил их же тренд-репорт, назвав это парадоксом доверия: AI используют все, но чужому AI не доверяет никто.

В заявках Agentic Dev Conf, куда мы с программным комитетом отбирали доклады, тот же парадокс, только с другой стороны: доверие к агентам не спускается стратегией сверху - оно строится руками и обычно снизу вверх. Поэтому маленькие команды владеют агентами на уровне, до которого корпорациям далеко: энтузиаст приручает инструмент, тащит в команду, команда - в компанию. Под это в программе даже выделили отдельную секцию - Tiny Teams: один-два инженера с парком агентов закрывают весь путь от идеи до релиза.

Конфа уже сегодня, кстати, среди спикеров будет Коля Шейко, а Тимур и Костя будут на круглом столе.
Конференция компактная, каждый доклад прошел плотный отбор - если будет возможность посмотреть онлайн или в записи, наверняка найдете свое: agenticdevconf.ru

Это не реклама (по крайней мере не платная, хехе) - скорее запоздалый пост в поддержку классных авторов и докладов) И, надеюсь, ребята из Онтико позже выложат хотя бы часть в паблик - потому что есть прям топовые доклады, полезные для индустрии.

Читать полностью…

Refat Talks: Tech & AI

#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- OpenAI запустила GPT-5.6 Preview (версии Sol, Terra, Luna), но администрация Трампа ограничила релиз: доступ только одобренным партнерам.

- OpenAI представила Jalapeño - собственный (совместно с TSMC и Broadcom) чип под инференс LLM.

- Google встроила computer use прямо в Gemini 3.5 Flash (раньше - отдельно).

- Anthropic запустила Claude Tag - общий Slack-агент на команду: контекст каналов, общая память.

- Anthropic добилась частичной разморозки Mythos 5 для критической инфраструктуры и обсуждает возврат Fable 5. В это же время OpenAI заявила о GPT-5.5-Cyber на уровне Mythos в поиске уязвимостей.

- OpenAI поделилась статистикой внутреннего использования Codex.

- Вышел новый Economic Index отчет Anthropic.

- SpaceX заключила сделку до $6,3 млрд с open-source стартапом Reflection, дав доступ к Colossus.

- Отток талантов из Google продолжается: ключевые разработчики Gemini Йонас Адлер и Александр Притцель уходят в Anthropic.

- По оценкам экс-сотрудников, более половины трафика Grok от xAI приходится на взрослый контент и ролевые чаты.

- Трамп подписал два указа по квантовым вычислениям включая ускоренный переход госорганов на постквантовую криптографию.

- Рынок труда под AI: Oracle сократила 21 тыс. человек (13% штата), Калифорния запустила первый трекер увольнений из-за ИИ, а AWS нанимает 11 тыс. джунов.

- Meta строит приложение рынков предсказаний Arena на аудитории Instagram и Facebook.

- Google вкладывает $75 млн в киностудию A24 ради совместных AI-инструментов для кинопроизводства.

- Компании массово уходят на дешевые открытые китайские модели: по UBS, 60% сокращающих AI-бюджет переключаются на них с роутингом под сложные задачи. А новая GLM-5.2 уже в топ-10 моделей мира.

- Exponential View выложили интересный отчет про AI-экономику.

- Amazon отменил уже снятый фильм про Альтмана, чтобы не рисковать сделкой с OpenAI. Netflix тоже отказался.

- Большой консалтер Bain & Company вайбкодит для фондов копии продуктов компаний-целей на due diligence: если AI воссоздает продукт за дни, моата нет.

- Европа боится отстать: брюссельский сценарий Европа-2031 рисует крах от нехватки датацентров, а консорциум EUROPA (Domyn) выиграл EU-грант на открытую модель 400B под 24 языка ЕС.

- Cloudflare с Chrome, Firefox и Edge запускает протокол PACT, верифицирующий легитимность веб-трафика без слежки за пользователем.

- Baidu открыла Unlimited OCR (распознает 40+ страниц за один проход), а Mistral выпустила OCR 4 со структурным разбором страницы и 170 языками.

- Qwen выложила open-weight AgentWorld - модели, симулирующие реальные среды для агентов.

- DeepReinforce открыла семейство кодинг-моделей Ornith-1.0 (до 397B MoE) на базе Gemma 4 и Qwen 3.5, по заявлениям SOTA среди открытых.

- Inception выпустила Mercury 2 - диффузионную reasoning-модель на ~1000 ток/с.

- Liquid AI выпустила LFM 2.5 на 230M - не-трансформер (state-space) для edge, на уровне трансформеров втрое крупнее.

- Свежие агентные бенчмарки: OSWorld 2.0 для computer-use (лучший лишь 20,6%) и CoffeeBench от Sakana и KPMG на бизнес-стратегии.

- Hugging Face выпустиля vllm jobs запуск приватного vLLM-эндпоинта одной командой на serverless-инфраструктуре.

- Figma на Config 2026 показала превращение слоев в код, инструмент Motion и vibe coding для плагинов.

- OpenAI обновила GPT-5.5 Instant: лучше с интентом, ограничениями и рекомендациями.

- Anthropic выпустила гайд как рулить Claude Code: skills, hooks, rules, subagents.

- Хороший критический разбор loop engineering и в тему подборка из 15 готовых copy-paste лупов.

- Aside - новый AI-браузер с вертикальными вкладками и поддержкой Claude/ChatGPT.

- hubble.md - markdown-блокнот для людей и агентов с живым превью.

- 👍 Vercel выпустила AI SDK 7 с мощными агентными возмозностями, TUI, единой телеметрией, сторонними харнесами и пр.

- 🤩 Executor - open-source шлюз, централизованно подключающий сервисы а агентам.

Читать полностью…

Refat Talks: Tech & AI

#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- SpaceX покупает Cursor за $60 млрд - одна из крупнейших сделок в истории AI. + Cursor анонсировала Origin - конкурента GitHub заточенного под агентов.

- Claude Code теперь умеет Artifacts: генерит интерактивные веб-страницы прямо из контекста сессии, с историей версий и приватностью для организации.

- OpenAI подвезла в Codex Record & Replay - показал задачу один раз, агент собрал переиспользуемый skill (пока только macOS), плюс поддержку Chrome DevTools Protocol.

- Anthropic крупно обновила Claude Design: дизайн-системы между проектами, правка канваса напрямую и синк с Claude Code.

- Google выпустила Android 17: приложения могут выставлять инструменты для on-device агентов (AppFunctions, Android MCP).

- Adobe выкатила в бету единого AI-агента для Premiere, Photoshop, Illustrator, InDesign и Frame; управлять можно из ChatGPT, Claude и Copilot.

- У OpenAI утекла отчетность за 2025 - очень растут косты, хоть выручка выросла ~x3, маржа ~x2, но операционно минус ~$21 млрд.

- Доля ChatGPT на рынке впервые упала ниже 50% - юзеры все охотнее прыгают между Gemini, Claude и Grok.

- Salesforce покупает Fin (бывший Intercom) за ~$3,6 млрд.

- DeepSeek закрыла раунд на $7,4 млрд при оценке выше $50 млрд и стала самым дорогим AI-стартапом Китая.

- Google теряет крупные таланты: Ноам Шазир, соавтор Transformer, уходит в OpenAI, а нобелевский лауреат Джон Джампер (AlphaFold) переходит в Anthropic.

- Лидеры G7 встретились с CEO OpenAI, Anthropic и Google DeepMind: на фоне права США отключать доступ к топ-моделям союзники хотят "американский AI без рубильника" и обсуждают схему доверенных партнеров.

- freefable.org: ведущие специалисты по кибербезопасности призвали США снять запрет с Mythos.

- Пентагон под присягой подтвердил боевое применение Grok: AI от xAI наводил удары США по Ирану через Project Maven. Anthropic из проекта вышла.

- Meta перевела ≈6500 инженеров на разметку данных и RLHF. Сотрудники недовольны.

- Anthropic выпустила интересный разбор ~400 тыс. сессий Claude Code.

- Anthropic поставила на паузу отдельную тарификацию Agent SDK и claude -p. Возможно, пересмотрит решение.

- Midjourney неожиданно пошла в медтех: открыла подразделение Midjourney Medical и строит ультразвуковой сканер тела (в ~100x быстрее МРТ).

- Snap представил AR-очки Specs за $2195 с цветным экраном и on-device AI; после анонса акции упали до исторического минимума.

- Moonshot ускорила Kimi K2.7 Code - режим HighSpeed до 6x быстрее (~180-260 ток/с).

- Бенчмарки недели: Ramp выложил приватный SWE-Bench из реальных инженерных задач, MyPCBench меряет агентов на Linux-десктопе, а AA-Briefcase - на бизнес-задачах.

- Databricks открыла Omnigent (Apache 2.0) - мета-оболочку над Claude Code и другими агентами с лимитами и правилами-триггерами (например апрув на git push).

- Google выпустила Open Knowledge Format - стандарт передачи контекста агентам (md + граф).

- Trace Commons призывает донатить трейсы coding-сессий в открытый датасет (CC-BY-4.0) для обучения open-weight моделей.

- ChatGPT убрала фичу Pulse (переехала в Scheduled Tasks) - а в тему появился killedbyopenai.com, кладбище закрытых продуктов OpenAI.

- Ponytail учит AI-агента сначала искать готовое решение и только потом писать код - по бенчмаркам это -54% строк и -20% стоимости (пресеты под Claude Code, Codex, Copilot).

- HumanLayer открыла доступ к агентному IDE на своем фреймворке Research-Plan-Implement (уже в Block и Uber): ставка на дисциплину против AI-слопа, 2-3x по всему циклу разработки, а не только в коде.

- ✨ Vercel выкатила drop.new - кидаешь папку или zip, получаешь задеплоенный сайт.

- 🤩 Сразу 2 заметных TS агентных фреймворка: Eve от Vercel - "Next.js для агентов" и Flue от команды Astro (на базе Pi).

Читать полностью…

Refat Talks: Tech & AI

Twenty CRM - классная опенсорс CRM и мой skill к ней.

Где-то пару месяцев назад переехали с платной CRM (год были на PipeDrive, до этого был Hubspot) на TwentyCRM на своем сервере. Уже успел много кому порекомендовать, но решил написать пост-обзор с некоторыми деталями и заодно поделиться своим скилом.

Для начала зачем? Ну как минимум это дешевле (стоимость VPS - это баксов 10, вместо $25-80 за каждого юзера - выходит в копеечку за год), а во-вторых она оказалась лучше примерно во всем что мне нужно от CRM.

Это не первая опенсорсная CRM, но, пожалуй, единственная, которая ощущается как взрослый, качественный продукт с отличным дизайном. Первое, что замечаешь - скорость, прям летает. Современный стек (TS, pg), легко настроить под себя data model, есть SDK и развитый API. Причем все это активно пилится: недавно вышла 2.0, где аппы можно строить прямо поверх CRM без правки кода, и строилось это так чтобы было удобно развивать кодинговыми агентами. 49k звезд, #1 опенсорсный CRM на гитхабе.

Но минус балл за то что нет своего CLI и скилла. Хотя сделать свой оказалось несложно.

За счет развитого API у меня ушло совсем немного времени, чтобы собрать вокруг Twenty ровно то, что мне нужно для работы из Claude Code / Codex.

Сначала я сделал CLI на базе их REST-api и ocli - это, кстати, опенсонс от @evilfreelancer и @neuraldeep. Получилось супер-просто, создаешь профиль с ссылкой на готовую Swager спеку и получаешь готовый CLI-тул. Кайф.

Потом завернул его в Skill - ставится одной командой:


npx skills add nobilix/twenty-crm-skill


Что он дает агенту: читать и менять данные в CRM - люди, компании, сделки, таски, заметки, кастомные объекты, CRUD всего этого.

Еще он подстраивается под любую схему. Завели кастомные поля или целые коллекции под свой процесс? Скилл подхватит их и подстроится под вашу дата-модель.

Со скилом стали чаще пользоваться CRM. Раньше вести ее было лень: прошла встреча - иди ищи контакт, кликай, записывай. Теперь просто пишу в чате "пообщались с тем-то, вот что надо отметить" - агент занесет сам, если надо залезет в транскипт Granola по MCP. Или "кто у нас был с похожим кейсом, напомни и поставь follow-up" - найдет и поставит таску с напоминанием. По сути разговариваешь с CRM, а не кликаешь по ней.

Вообще такое решение рекомендую всем, у кого есть готовый REST API с OpenAPI/Swagger: делаете CLI wrapper + тонкий SKILL.md вместо своей обертки. Быстро, надежно, нечего сапортить. Ocli классный, но если ищите альтернативы - есть еще, например https://rest.sh и другие. OpenAI предлагает поручить агенту написать свой CLI, но мне такой вариант кажется очень хардкодным - под чуть другую схему надо менять код и делать ребилд, но в целом - тоже решение.

А возвращаясь к самой CRM - как по мне отличный баланс простоты, скорости и dev experience: гибкая data model с кастомными объектами и полями без кода, вьюхи на любой вкус (таблица/канбан/календарь), визуальные workflow-автоматизации по триггерам (в том числе LLM-блоки) и развитый API (REST + GraphQL). Ну и встроенные AI-фичи очень активно развиваются.

Надеюсь, кому-нибудь будет полезен обзор, скилл или сам подход.

🔥 ➕ 🔁 @nobilix

Читать полностью…

Refat Talks: Tech & AI

Диплинки в кодинговых агентах

Deeplinks - простой, но иногда незаменимый прием для быстрого открытия программ прямо в нужном состоянии (как URL в браузере, только для приложений).

Я все чаще пользуюсь именно десктопными версиями Claude Code и Codex, и иногда надо из другого приложения открыть конкретную сессию или создать новую в конкретном проекте. Тут-то и помогают эти самые диплинки - ты просто формируешь ссылку вида claude://code/new?folder=/path&q=... или codex://threads/new?path=...&prompt=... и вуаля: при клике апп откроется и покажется на первом плане именно на этой "странице".

Как это можно использовать? Несколько идей.

- Дашборд проектов. Страничка в Obsidian / Notion: по проекту две ссылки - "продолжить последнюю" и "новая сессия". Или написать свой простой апп с обзором сессий именно так, как тебе удобно, по клику - открывается Claude / Codex.

- Всякие лаунчеры, типа Raycast. Можно открывать сессии откуда угодно. Например, удобно в Todoist задачу поставить ссылку на конкретную сессию в приложении агента.

- Human in the loop. Пуш / имейл / сообщение "сессия ждет ответа" с прямой ссылкой на апп. Или написать инструкцию чтобы когда клод имеет в виду другую сессию - давал линк на нее.

- Черновик промпта. Алерт или тикет с q=Investigate incident: ... - кликнул, промпт уже в поле: посмотрел черновик, захотел - дописал, отправил. Причем такое можно встраивать прямо в сайты.

- Handoff между агентами. Claude сделал фичу и в конце отдает open "codex://threads/new?path=...&prompt=Review the diff". Кликнул - и ты телепортировался в Codex. Или наоборот.

- Еще можно дернуть программно, скриптом или из терминала. Например, на маке это команда вида open "claude://code/continue?session=last".

Доки тут: Claude Code CLI, Claude Desktop, Codex, секция Deep links. Но там есть не все.

Ниже шпаргалка (раскрывается).

Claude Code App:
- claude://code/new?folder=/path&q=... - новая сессия в папке, промпт уже в поле.
- claude://code/continue?session=last - последняя сессия.
- claude://code/continue?session=local_<id> - конкретная сессия. Id - это имя json-файла в ~/Library/Application Support/Claude/claude-code-sessions, в самом приложении его нигде не показывают.
- claude://code/needs-input - сессия, которая дольше всех ждет ответа на permission.
- claude://resume?session=<uuid> - импорт CLI-сессии по uuid из ~/.claude/projects.

Три последних маршрута в доках отсутствуют, вытащил из анализа билда приложения.

Codex App:
- codex://threads/<id> - конкретный тред. Id - это uuid в имени rollout-файла в ~/.codex/sessions, или Cmd+Opt+C в самом треде.
- codex://threads/new?path=/path&prompt=... - новый тред в папке с промптом. Есть еще originUrl, чтобы тред помнил, откуда пришел.
- codex://new?prompt=... - короткий вариант того же, нужен хотя бы один параметр.
- codex://settings/..., codex://skills, codex://automations, codex://plugins/... - прыжок сразу в нужный раздел.
- Правой кнопкой по чату - Copy deeplink, или Cmd+Opt+L на текущем. Все это есть в доках.

Нюанс: некоторые приложения диплинки не открывают - Notion и Telegram, например, решается простой страницей с HTTP редиректом, типа такой.


Начал копать в эту тему потому что планирую написать себе небольшой лаунчер с быстрым поиском и фильтром сессий, где нужная сессия находится и создается в одно касание. Пока писал пост, нашел отличный репо awesome-deeplinks - схемы для кучи приложений (вы только посмотрите сколько там всего!).

Короче, довольно удобная штука, может и вам пригодится.

🔥 ➕ 🔁 @nobilix

Читать полностью…

Refat Talks: Tech & AI

Qwen 3.8 27B, локальный инференс и мои эксперименты с подбором железа

Про эту модель уже несколько недель пишут "Opus 4.6 у себя дома". Нет, конечно. Но, черт, это первая небольшая локальная модель, которую я готов всерьез обсуждать в агентных сценариях, а не для чата по базе знаний.

Небольшие локальные модели (которые влезут в домашний GPU) на агентных задачах часто зацикливается, либо ломают tool-calling. Qwen 3.8 27B, пожалуй первая в моих тестах, у которой это не разваливается. На агентном индексе Artificial Analysis она #8 из 140 моделей, сразу за Kimi K2, которая в сто раз больше по параметрам, и реддите ее дружно хвалят и тд.

Мои тесты этой (и не только) модельки совпали с вполне прикладной задачей - выбрать железо для локального AI-периметра. Надо выбрать одновременно и модель, и железо. Для этого решил арендовать стенды на Vast.ai: 3090 за $0.13/час, там же брал 4090, 5090 и GB10 (тот же DGX Spark). Написал skill поверх их CLI, и дальше вместе с Claude поднимал и тушил машины для экспериментов, гонял бенчмарки по SSH и вел журнал. Десятки замеров, четыре типа железа, ряд моделей - все вместе примерно пару десятков баксов.

Вот на контрасте с соседями по весовой категории (уместиться в 5090 или пару 3090) плотная Qwen 3.8 и выстрелила. Единственная из всех стендов дважды нашла все 10 заложенных дефектов в тестовом договоре. 100 из 100 по tool-calling. На заведомо нерешаемой задаче остановилась за 4 шага и честно отчиталась, пока конкуренты (в том числе MoE) зацикливались. Ну и да - первая локальная модель, которая осилила мой лифтовый вайб-чек (посмотрите пост, в декабре у ChatGPT лифт не ехал!). Минусы тоже есть: например, модель требует высокой полосы (на маке и Spark работает медленно) и, главное - знаний о мире у 27B, заметно меньше. Но знания агенту приносят тулы и поиск, а вот дисциплину в цикле извне не принесешь.

Если присматриваетесь к локальному инференсу под агентов, вот что я бы хотел знать заранее:

1. Считайте секунды на шаг агента, а не только токены в секунду. У меня модель с втрое большим декодом делала шаг за 2.1 секунды против 1.2 у "медленной" и решала задачу за большее кол-во шагов.

2. Часто говорят только про память, но тут есть как минимум три оси. VRAM решает влезет ли модель и останется ли место под кэш. Пропускная способность памяти - очень важный параметр, влияет в первую очередь на скорость генерации ответа (поэтому старенькая 3090 все еще тащит). Compute решает, как быстро модель переваривает входящий промпт. Это упрощенно, вот например неплохой визуальный разбор roofline-модели. Отсюда следует много всего, например что при низкой полосе (на маках, спарках) лучше брать MoE модели.

3. Чат упирается в память, агент - в compute, контекст и кэш. Самое дорогое в агентном цикле - не ответ, а чтение промпта. Шагов много и на каждом шаге агент заново отправляет всю историю. Тут экстремально важен префикс-кэш.

4. Смена движка или его настроек может дать разницу в разы. Вариантов много: vLLM, SGLang, llama.cpp, кастомные движки вроде NInfer. Перебирать это руками долго, поэтому у меня этим занимался агент в стиле авторесерча: поднял ряд стендов, прогнал матрицу экспериментов параллельно, записал в журнал и тд.

5. Комьюнити уже прошло часть пути за вас: есть и готовые рецепты типа 3090-club и тулы вроде llmfit: сканирует железо и подтягивает реальные замеры других пользователей. Только эти бенчмарки регулярно не сходятся с реальностью. Тестируйте на своих задачах.


По итогам, кстати, для этой модели по соотношению цена/качество победила пара 3090. А самое интересное в этой системе - архитектура "советника": локальная модель делает всю работу, а для редких сложных вопросов зовет фронтир через строгий гейт, который не выпускает приватные данные за периметр. Но это уже отдельный пост.

upd: кстати, если хочется уже сейчас протестить, то у Валеры на neuraldeep она доступна бесплатно

🔥 ➕ 🔁 @nobilix

Читать полностью…

Refat Talks: Tech & AI

Вот сколько бы ни хоронили промпт-инжиниринг (никогда не понимал этого пафосного названия), но то, как вы формулируете запрос, по-прежнему во многом определяет качество результата.

Например, мой частый совет из практики - Заменяй summarize на extract. "Суммаризируй" дает общий пересказ, а вот "Извлеки ключевые факты списком, по одному на пункт, без комментариев" - операция ближе к парсингу. Точный глагол = точный режим.

Что еще часто использую:

Просить маркировать уверенность вместо "не галлюцинируй". "Пометь каждое утверждение: факт из текста / вывод / догадка". Жесткая версия для документов: "процитируй точное предложение под каждым пунктом" - цитату не подделаешь незаметно.

Разворачивать направление: пусть модель спрашивает вас. "Прежде чем отвечать, задай мне 3-5 вопросов, которые сильнее всего изменят твой ответ". Она часто спрашивает про то, о чем вы не подумали. В СС так и пишу обычно: используй AskUserQuestion.

Заставлять критиковать свой ответ. "Раскритикуй ответ выше: что неточно, чего не хватает. Потом перепиши". Генерация и оценка - разные режимы, популярный grill-me скилл, кстати, cюда же, но неплохо работает и просто фразой.

Отделять инструкцию от данных.. Если в тексте за промптом идет сам инпут, то оборачивайте данные тегами (`<text>...</text>`) или тройными бэктиками - особенно когда инпут длинный или содержит собственные инструкции.

Часто диктовать лучше чем печатать. Голосом вы отдаете в разы больше контекста за то же время, а промпту вредят не лишние слова, а недосказанность (ramble session как назвал это Карпаты). База, но напомнить не лишне, потому что использую давно и почти каждый день, но встречаю еще людей, которые брезгуют и из принципа набирают куцый текст двумя пальцами даже там, где больше деталей бы выдали голосом.

Этажом выше мета-приемы. Про один я уже писал: терминология домена - назвав вещь ее именем, попадаешь в самую суть, и, между прочим, LLM вознаграждают экспертизу - модель усиливает качество инпута, а не подменяет его. Еще пример: "я, вероятно, неправ, но..." перед своим тезисом - удивительно полезно. Модели очень хотят угодить, и, поставив свою точку зрения под сомнение, вы как бы разрешаете модели проверить ее честно, а не поддакивать.

И да, модели правда становятся все понятливее, все важнее становится доменный контекст, а не большое количество детальных инструкций. Но пара нужных слов все еще меняет ход ответа.

Это моя базовая база, из памяти, хотел зафиксировать заметкой. Какие приемы у вас в постоянной ротации?

🔥 ➕ 🔁 @nobilix

Читать полностью…

Refat Talks: Tech & AI

Железки - это весело. Пятничный пост про DIY.

Знаете, софт - это хорошо, но есть особый шарм именно у железяк: когда что-то щелкает, пищит, светится, включает и выключает вещи в комнате. Что-то осязаемое. Даже если девайс делает какую-то малополезную мелочь.

Еще вся эта DIY-электроника стала сильно проще. Помню, раньше написать нормальную прошивку занимало мгого дней, а сейчас: втыкаешь девайс по USB, говоришь Claude Code или Codex, что хочешь получить, и агент сам коннектится, ставит тулчейн, пишет прошивку, заливает, читает логи.

Например, этим летом я собрал себе климат-контроль для кондиционера, буквально за пару часов на выходных: M5Stack Stick (это готовый блок на ESP32 с экранчиком, кнопками, блютузом, Wi-Fi за $10-20). Добавил только ИК + датчик температуры, и попросил Клода написать прошивку и веб-приложение.
Стало жарче 26° - сам включился, опустилось ниже 23° - выключился, ночью спит. Управляется с телефона, слушается Siri. Реально, пользуюсь каждый день)

Еще есть проект девайса, который автоматически ставит телевизор на паузу, если ребенок подходит к нему слишком близко. Ну это из последнего, раньше, конечно, много всего собирал и тем удивительнее видеть, как все упростилось с тех пор.

Хотел сначала накидать сюда полезных ссылок и инструкций, но, честно говоря, вам проще открыть AI-чат и начать расспрашивать: как это вообще работает, какие проекты можно собрать, что для этого нужно и т.д. И поверьте, если вам такое интересно - затянет. Еще бы время на это находить почаще, но когда нахожу - всегда фаново)

А, ну еще хотел спросить, что вы такого интересного делаете или планируете делать помимо софта?

Читать полностью…

Refat Talks: Tech & AI

#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- Anthropic встраивает невидимые водяные знаки во все тексты Claude, а следом планируют OpenAI, Google и другие.

- OpenAI: Computer History отдает ChatGPT и Codex историю работы в приложениях как контекст, вышла Linux-версия, а в Business появятся Premium-места за $125 с 5x лимитами и без 5-часового окна.

- Anthropic сделала временную дисконт цену Sonnet 5 постоянной: $2 и $10 за миллион токенов.

- OpenAI показала Ultrafast: GPT-5.6 Sol на железе Cerebras выдает до 750 токенов в секунду.

- Chrome-расширение Claude теперь интегрировано с Cowork, а Claude Code научился сам продолжать задачу после сброса лимита.

Блок с релизами моделей (раскрывается):

- SpaceXAI выпустили Grok 4.6 - близок к Sol и Opus при вдвое меньшей цене (полевой гайд).

- Google выпустила Gemini 3.7 Flash - цена вдвое ниже 3.6 при лучшем перфомансе.

- Meta вернулась в открытые веса: мультимодальная Muse Glimmer 30B.

- Qwen выпустила Qwen3.8-27B, сообщество зовет ее маленьким Opus 4.6 для ноутбука. Еще выкатили веса Qwen 3.8 Max.

- DeepSeek вывела V4 Pro из превью и открыла веса и резко поднимает цены с 16 августа.

- Microsoft представила MAI-Thinking-1, первую свою reasoning-модель, собранную с нуля.

- Cohere выпустила North Micro Vision - компактную VLM под Apache 2.0 с фокусом на документы.

- Solar Pro 4 от Upstage прыгнула с 14 до 42 по Intelligence Index, особенно на агентных задачах.

- Медиа-модельки: MiniMax выложила музыкальную Music3 с русским языком и запуском от 8 ГБ VRAM, Lightricks обновила видеомодель LTX-2.5 до мультишотовой генерации, а Deepgram запустила Flux TTS с откликом 80 мс.


- xAI запустила Grok Bot: у каждого агента своя облачная Linux-машина с браузером и терминалом, учится по одной демонстрации. Oткрытый аналог появился быстро.

- DeepSeek открыла агентный харнесс dsh под MIT, где все является плагином с хот-релоадом (уже оброс каталог плагинов).

- Spotify выпустила Xirp - Claude Code, Codex и Gemini CLI в одном окне.

- Google запустил Sheets canvas: таблица превращается в интерактивное мини-приложение.

- DeepMind встроила перевод языка жестов в Pixel 11.

- Цукерберг выложил манифест на 6000 слов: персональные агенты и тезис, что широкое распространение AI безопаснее централизации.

- Apple обучила собственную модель для Китая при поддержке Alibaba, первой из иностранных компаний пройдя регулятора.

- Исследователи научились расшифровывать зашифрованные цепочки рассуждений Anthropic, OpenAI и Google.

- Белый дом разрешил частным компаниям наступательные кибероперации против иностранных группировок.

- Manus отделяется от Meta по требованию китайского регулятора, данные надо забирать вручную до 23 августа.

- Игорь Бабушкин, сооснователь xAI, привлек $1,1 млрд в River AI - домашний компьютер для AI.

- Foreman от Vercel Labs - шаблон софтверной фабрики: задачи из GitHub и Linear проходят четыре станции и выходят отревьюенным черновиком PR.

- Vercel завел приватные паки скиллов, которые можно шарить внутри аккаунта.

- Интересный техобзор харнессов вокруг DeepSeek V4 Flash: восемь штук на 30 реальных задачах, победил Pi.

- Несколько интересных бенчмарков: ExtractBench от LlamaIndex, AA-AnalystAgent, и Optima - платформа чтобы гонять бенчмарки на своих нагрузках.

- Интересный разбор про текстовые водяные знаки.

- /show-me - скилл, который заставляет агента отвечать деревьями, диаграммами и псевдокодом вместо простыней текста.

- Ref - общий режим планирования для команды перед тем, как агенты начнут строить.

- 👍 treg - каталог из 2600 agent-friendly инструментов, "OpenRouter для агентных тулов"

- 🤩 seoskill.dev - SEO-скилл для агентов.

Читать полностью…

Refat Talks: Tech & AI

#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- Alibaba выпустила Qwen3.8-Max: 2,4T параметров, контекст 1M, вчетверо дешевле Opus 5.

- OpenAI обновила Sol, обещают меньше ошибок, а бесплатным дали безлимитную GPT-5.6 Luna.

- Agent Plugins - открытый стандарт упаковки скиллов и MCP-серверов в плагины; за ним OpenAI, AWS, Microsoft, Vercel, Cursor и другие.

- Джефф Дин уходит из Google строить Discovery Loop - автоматизацию науки и ML.

- OpenAI оценила внутреннюю модель Astra как критическую по киберспособностям и приостановила часть работ.

- Anthropic выкатила self-hosted среды для Claude Code, научила сессии переписываться между собой и делает auto mode режимом по умолчанию.

- Meta выпустила терминального кодинг-агента Muse Code и модель Muse Spark 1.2.

- xAI выпустила картиночную модель Imagine Image 2.0.

- Крупнейшая атака на npm: скомпрометированы 868 пакетов с 2 млрд установок в месяц.

- Белый дом вывел открытые модели из-под обязательного тестирования.

- Anthropic собирает команду для разработки собственных AI-чипов.

- CNBC: отрыв США от Китая в AI практически исчез.

- DeepSeek предупредила о значительном повышении цен на API (до 5x).

- Alibaba начнет брать процент с провайдеров, продающих доступ к следующим поколениям Qwen.

- Cloudflare провела Agents Week: Cloudflare OS - общий агентный воркспейс, Computer, Kitesurf - браузер для агентов без Chromium, Wallets, WebMCP, Agent Access Model для корпоративного контроля.

- Anthropic запустила inference hooks: инлайн контроль каждого промпта и тула.

- NYT разбирает, что компании получают за AI-траты: посчитать не может никто, Linux Foundation создала Tokenomics Foundation.

- Meta дает дешевый доступ в обмен на данные для обучения.

- Google показала Science One - генерацию научных статей "без галлюцинаций".

- Две новые видеомодели: FLUX 3 Video от Black Forest Labs и Wan 3.0 от Alibaba.

- ByteDance выпустила SeedRealtime: полнодуплексная, аудиовизуальная.

- Liquid AI выпустила LFM2.5-2.6B - агентную модель для смартфонов, ~30 токенов в секунду на Snapdragon.

- Mistral выпустила Shieldstral - открытый 3B safety-классификатор.

- DeepGrove показала Maple-Preview - открытую 20B модель на тернарных весах, 200+ ток/с на Mac Mini.

- Pokee AI заявила Pokee-Isaac 28B с контекстом 10M токенов и запуском на одной RTX 4090.

- Celeris-1 возглавил рейтинг скорости Artificial Analysis (~1765 ток/с).

- Качество моделей сильно зависит от инференс-провайдера (у Kimi K3 разброс скорости между провайдерами 312%), Artificial Analysis даже добавила Endpoint Accuracy Index.

- Backflip AI превращает физическую деталь в CAD-файл за минуты и примерно $10.

- Warp выделила своего агента в отдельный CLI с роутингом по моделям.

- Prime Intellect выпустила Prime Agent - открытый самоулучшающийся харнесс вокруг python-REPL.

- Бенчмарки недели: APEX-Accounting для бухгалтерии, приватный SWE-Bench от Ramp на продакшн-задачах, Supabase Evals, плюс MerchantBench и Boundary-Bench.

- Mference запускает DeepSeek V4 Flash 284B в 5.3 ГБ памяти на маке, подтягивая экспертов с SSD.

- Photon 2.0 компилирует модели в мегаядра: весь forward pass - одна GPU-программа.

- TokTier: токенизация съедает до 64% TTFT в агентных нагрузках; stateful-сервис токенизации это чинит.

- Conductor Cloud - мультиплеерные облачные воркспейсы для кодинг-агентов.

- GenOffice - открытый AI-офис от Genspark: собрали за неделю и $10K на токены.

- FutureSearch - AI-прогнозирование по запросу: спрашиваешь "что будет, если я сделаю X" и получаешь прогноз с вероятностями.

- OpenRouter выкатил Ori Eval - автоподбор модели под задачи конкретного репозитория.

- 🔥 Firecrawl выпустила anydoc: конвертация любых документов в Markdown за миллисекунды, на Rust.

- 🤩 Comp AI выложила открытый agent-first CRM с долгоживущими ресерч-агентами, лицензия MIT.

Читать полностью…

Refat Talks: Tech & AI

#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- OpenAI снизила цены на GPT-5.6 и объяснила зачем.

- Anthropic обновила MCP: stateless-архитектура, официальный статус у Apps и Tasks и пр.

- Moonshot выложила веса Kimi K3 - теперь модель доступна на десятках провайдеров.

- OpenAI выкатила в API GPT Transcribe и потоковую GPT Live Transcribe.

- Про необходимость притормозить теперь говорит не только Дарио, но и Альтман и больше тысячи сотрудников AI лаб подписали открытую инициативу об этом.

- Anthropic изложила позицию по открытым весам: запрещать не надо, надо контролировать дистилляцию и тестировать мощные модели.

- NVIDIA собрала Open Secure AI Alliance, Microsoft AI представила MAI-Cyber-1-Flash и Vercel в тему выложил бенчмарк DeepSecBench.

- Claude Mythos почти автономно нашла слабости в постквантовой схеме HAWK и AES.

- Anthropic проверила 141 тысячу своих киберучений и нашла три случая, когда модели вышли наружу и скомпрометировали боевые системы реальных компаний.

- OpenAI открыла Codex Security CLI.

- ChatGPT добрался до 1 млрд пользователей в неделю.

- В ChatGPT/Codex вернули пятичасовое окно.

- OpenAI раздает ученым бесплатный доступ к фронтир-моделям.

- Grok Voice Think Fast 2.0 научился слушать, думать и говорить одновременно. В Grok добавили встроенный конструктор приложений с хостингом.

- Google выкатил Gemini Distillation Service - обучение маленькой модели на рассуждениях большой.

- Google выпустил генератор музыки Lyria 3.5: треки до трех минут, контроль BPM и тд.

- Cursor запустил в Индии тариф Start за ≈$7.

- США запретили импорт китайских гуманоидных и четвероногих роботов.

- В девяти американских школах учебный год начнут защищать боевые дроны.

- ASML просела на новости, что в Шанхае начали серийно выпускать DUV-литографы.

- ЕС со 2 августа включает обязательную маркировку AI контента.

- В Китае заработали биржи прав на внешность: лицо "сдают в аренду".

- AI-компании скупают старые книги, режут прессом, сканируют и уничтожают.

- Тренд недели: мы переусложняем промпты. Под новые модели надо не добавлять инструкции, а убирать.

- DeepSeek вывела V4-Flash из превью в API с поддержкой Codex и в тот же день выложила веса.

- Thinking Machines выпустила Inkling-Small, качество почти как у флагмана при четверти размера.

- MiniMax открыла мультимодальную H3: единый контекст по тексту, картинкам, видео и аудио.

- LightOn выложила mDenseOn и mLateOn - полностью открытые мультиязычные ретриверы под длинный контекст и код.

- Тема недели: harness решает не меньше модели. У OpenAI две настройки харнесса подняли результат Sol на ARC-AGI-3 с 7.8% до 38.3%, Databricks намерила двукратную разницу в цене между харнессами при том же качестве, а AgentRadio почти удвоил результат асинхронным обменом сообщениями между агентами.

- WSJ пишет про новый класс предпринимателей: компании на миллион долларов с одним сотрудником.

- WASTE - движок для моделей (включая Kimi K3), которые больше вашей памяти.

- Саймон Уиллисон выпустил smevals - прогон компактных наборов эвалов сразу по нескольким моделям, харнессам и промптам.

- sharechat - расшарить сессию Claude Code или Codex по ссылке, читающему не нужен ни аккаунт, ни логин.

- Coast - полностью локальная память для вас и ваших агентов, собирается из того, что вы видите на своем Mac.

- Как DoorDash, Instacart и Uber Eats встроили LLM в поиск тремя разными способами: обогащение графа офлайн, понимание запроса и файнтюн эмбеддингов.

- 👍 YC выложил в опенсорс QM - мультиплеерный агентный харнесс, на котором внутри работают бухгалтерия, юристы, ивенты и инженеры.

- 🤩 Awesome Free AI Books - 30+ бесплатных книг по AI/ML. И отдельно хорошая книга-гайд по Agentic AI.

Читать полностью…

Refat Talks: Tech & AI

#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- Релиз Claude Opus 5: по заявлениям компании близко к Fable 5 за половину цены. Промптить и строить контекст надо иначе.

- Модели OpenAI вырвались из песочницы, вышли в интернет и увели ответы с серверов Hugging Face, которым пришлось использовать китайские модели чтобы анализировать происходящее.

- Ровно на этом фоне в Палату представителей внесли AI Kill Switch Act: рубильник для отключения опасных моделей.

- Google выпустил Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber. Задачи решается за меньшее число шагов.

- Kimi K3 уличили в дистилляции (сама представляется как Claude), Белый дом обвинил Moonshot в обходе экспортного контроля, Минфин пригрозил санкциями.

- Китай в ответ обсуждает запрет на выкладывание весов за рубеж.

- Anthropic заплатит $1,5 млрд авторам за книжное пиратство (обучение - fair use, наказали за хранение).

- Anthropic закупит у AMD до 2 ГВт мощности и AMD представила Helios - первую rack систему.

- Google разрабатывает чип Frozen v2 с архитектурой Gemini, вшитой прямо в кремний.

- OpenAI запустила Presence - голосовых и текстовых агентов для корпоративной поддержки, только для энтерпрайза.

- ChatGPT Voice приехал в десктоп: общаясь голосом можно запускать и менеджить задачи в Work и Codex.

- Anthropic обновила голосовой режим Claude: вместо Haiku теперь Opus и Sonnet с переключением на лету, подтянулись коннекторы.

- Anthropic [выпустила] плагин (https://x.com/claudeai/status/2079990597973057691) Claude Security для многоагентного поиска уязвимостей в репо.

- Claude Cowork учится, наблюдая за вами: записываете экран и проговариваете шаги, на выходе скилл, который Claude повторит. Codex недавно релизил похожее.

- Claude Desktop также получил поддержку iOS-симулятора.

- Alibaba показала превью Qwen3.8 Max на 2,4 трлн параметров.

- В Шанхае учредили Всемирную организацию по сотрудничеству в сфере ИИ: 29 стран, дают открытые китайские модели и учат локальных ML-инженеров.

- Еврокомиссия оштрафовала Google на 890 млн евро по DMA.

- Винт Серф ушел из Google делать DNSid - открытый стандарт идентификации агентов поверх DNS.

- YouTube отключит монетизацию контент-заводам.

- Netflix использовал AI примерно в 300 фильмах и сериалах и заодно рассказал как поднял свой LLM-инференс в продакшене.

- Неделя роутеров: Cursor Router, Ramp Router экономит 30% и объясняет механику, Runway роутит генеративную медиа.

- Вышла FLUX 3 - изображения, видео, аудио и физические действия в одной архитектуре.

- Poolside выложила Laguna S 2.1 - 118B MoE с 8B активных под агентный кодинг и длинные задачи. Контекст 1 млн, открытая лицензия.

- Alibaba выпустила Qwen Image 3.0: модели можно дать полноценное ТЗ на инфографику или интерфейс.

- Джек Дорси запустил Buzz - опенсорсный воркспейс где люди, агенты и репозитории в одном канале.

- Google опубликовала AI & Economy ATLAS.

- YC обновил список желаемых стартапов: AI выходит в физический мир - образование, здравоохранение, оборонка, финансы и заводы.

- Agent Client Protocl (ACP) v2 вышел в драфте.

- draw-your-font - скилл, превращающий фото вашего почерка в устанавливаемый шрифт.

- OpenWorker от Эндрю Ына - локальный десктопный AI-коллега, который работает с вашими файлами и приложениями.

- GenReasoning выпустила BackSearch - поиск и фетч по замороженному архиву веба на заданную дату.

- Карпаты снова назвал вслух очевидный тренд, и все побежали: ramble-coding (диктовать свои мысли эффективнее чем промптитить текстом).

- 🤩 Две красоты для продуктовых лендингов: Canvas UI - библиотека эффектных компонентов, отрисованных на canvas, с MCP в комплекте, и scroll-world - скилл, собирающий из бренда скроллируемый 3D-мир. А еще Rivet для генераций вариантов дизайна.

Читать полностью…

Refat Talks: Tech & AI

#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- Moonshot выпустил Kimi K3 - крупнейшую открытую модель: 2.8 трлн параметров, контекст 1М, мультимодальность. По бенчам уверенно бьет Opus 4.8 и Terra, до Fable и Sol дотягивает не везде. $3/$15.

- Thinking Machines выпустила Inkling - первую открытую модель лаборатории Миры Мурати: MoE на 975B, контекст 1 млн. Лучшая открытая модель из США, но позади топовых китайских.

- Anthropic передумала убирать Fable 5 из подписки: с 20 июля модель остается только в Max и Team Premium и в пределах 50% лимитов. Pro получит разово $100 кредитов, дальше по ценам API: мощностей на всех не хватает.

- OpenAI признала баг с удалением файвлов GPT-5.6 в Codex. И Британский AISI нашел в GPT-5.6 Sol универсальные джейлбрейки.

- OpenAI выпустила клавиатуру Codex Micro, а первым большим устройством OpenAI, по данным Bloomberg, станет мобильная колонка-компаньон.

- Google переименовала NotebookLM в Gemini Notebook, продукт продолжает развиваться внутри Gemini. А Gemini Spark обзавелся новыми фичами: правит Docs, читает комментарии в Sheets/Slides, стал на 50% быстрее.

- Claude Code Artifacts получили публичные ссылки и совместное редактирование, а еще научились вызывать MCP-коннекторы - артефакт превращается в живое приложение с доступом к данным зрителя.

- Grok Build CLI поймали на выгрузке целых репозиториев с полной историей в облако xAI, включая файлы, которые агенту запрещено открывать. На фоне кризиса доверия Маск объявил, что клиент становится опенсорсным.

- PrismML выпустила Bonsai 27B - первую модель такого класса, работающую на смартфоне: 1-битные и тернарные веса ужимают ее до 3.9-5.9 ГБ при ~90% качества. CEO уже ведет переговоры с Apple.

- Еврокомиссия обязала Google по DMA дать сторонним AI-ассистентам тот же доступ к Android, что у Gemini.

- Apple готовит качественно новую линейку чипов: M7 Ultra, проектируется с памятью до 1.5 ТБ - задел под локальный инференс и серверный чип.

- Google откладывает Gemini 3.5 Pro на месяцы, акции Alphabet упали на 4%

- a16z: расходы на AI-токены на сотрудника в топ-1% компаний сравнялись со средней зарплатой инженера. При этом компании с высокой интенсивностью AI штат растят, а не режут.

- Cognition разобрала, как замена Opus 4.8 на Fable 5 снизила счет Devin.

- Торвальдс ответил критикам AI-кода: AI это инструмент, Linux не входит в анти-AI проекты, недовольные могут форкнуть или уйти.

- Борис Черный (Claude Code) описал четыре стадии внедрения AI в компаниях.

- OpenAI изложила пять практик оценки бизнес-ценности AI-агентов: полезная работа за доллар вместо цены токенов.

- DecartAI выпустила Lucy 2.5 - realtime AI-видеоредактор, у fal уже доступен по WebRTC для live video-to-video.

- Telegram запустил Serverless - хостинг ботов прямо в облаке Telegram.

- LM Studio представила Bionic - агента для кодинга, ресерча и документов на открытых моделях.

- Schema - harness, где агент пишет механику игры как исполняемую программу и планирует внутри нее: 99% на ARC-AGI-3 Public.

- Пара интересных бенчмарков: Long Horizon Terminal Benchmark и WANDR бенчмарк research-агентов от Perplexity.

- AI Engineering Survey 2026 опросил 1000+ AI-инженеров про выбор моделей, build vs. buy и кто реально шипит с AI.

- 🤩 Красивое Эссе "Код как медиум для мышления": что мы теряем, когда больше не пишем код сами.

- 👍 The State of Open Source AI - интересный отчет: где опенсорс уже обошел закрытые модели, где не нужен фронтир и тд.

- 🔥 Scan - попросите Claude или Codex построить визуальную карту вашей кодовой базы, карта наглядная и можно пошерить.

Читать полностью…

Refat Talks: Tech & AI

NameThatUI: словарь вместо "сделай красиво"

Год назад я писал, что почти все AI-фронтенды выглядят как близнецы. Модели с тех пор заметно прокачались в дизайне, но почему все еще так много UI-слопа? Потому что "сделай красиво" все так же не работает, надо вникать и хорошо доносить что именно тебе нужно.

Сегодня про пару тулов, которые как раз про это. Главный герой - NameThatUI, визуальный словарь UI.

Работает так: описываешь штуку как получится - "темный полупрозрачный слой за попапом" и получаешь ее настоящее имя (scrim), анатомию с названием каждой части, имя в коде и готовый промпт для агента. Плюс отдельный debug-промпт: список типовых фейлов, которые стоит исключить первыми - "cmd+K листенер висит не на том скоупе, фокус утекает из диалога". Или даже не описываешь, а просто видишь, что тебе нужно, и используешь правильные термины.

Отдельный раздел - атлас стилей. Glassmorphism vs neubrutalism, 3-5 признаков каждого стиля и готовый бриф для агента. Пока еще молодой, будет пополняться.

Та же механика есть и уровнем выше - 21st.dev: каталог блоков веб-страницы. Heroes, calls to action, FAQs, футеры - у каждого блока живое превью, вариации и кнопка "Copy prompt" + хорошая интеграция с агентами.

Мне кажется, это хороший паттерн: инструменты, которые образовывают в процессе использования, позволяют направлять правильно, вместо того чтобы слепо отдавать на откуп агенту.

🔥 ➕ 🔁 @nobilix

Читать полностью…

Refat Talks: Tech & AI

#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- Anthropic выпустила Claude Sonnet 5 - близок к Opus 4.8, 1M, промо-цена, но новый токенизатор делает модель более прожорливой.

- США сняли экспортные ограничения: Fable 5 вернулась глобально (до 7 июля включена в подписки).

- Anthropic запустила Claude Science для ученых и программу AI drug discovery.

- Meta показала Brain2Qwerty v2: неинвазивное чтение печатаемого текста из мозга через MEG-шлем, 61% точности, код и датасет открыты.

- Anthropic обсуждает с Samsung производство собственного inference-чипа на 2-нм техпроцессе.

- OpenAI показала клавиатуру Codex Micro (детали 15 июля).

- OpenAI обсуждает передачу правительству США 5% акций (≈$42 млрд).

- Google выкатила Nano Banana 2 Lite - самую быструю и дешевую image-модель линейки, и Gemini Omni Flash - генерация и правка видео текстом по $0.10 за сек.

- Hardware-событие недели: Etched вышла из стелса с $800 млн инвестиций и $1 млрд+ заказов до первых поставок - вызов Nvidia со специализированным железом под инференс.

- Meituan (да, доставка еды) выпустила LongCat-2.0: MoE на 1.6 трлн параметров (48B активных), обучена целиком на 50 тысячах китайских чипов.

- Meta строит облачный бизнес на избыточных AI-мощностях.

- При этом Meta тайно гоняла внутренние сервисы на Gemini вместо своих Llama - и Google отрубил доступ за превышение лимитов.

- По данным The Information OpenAI нашла способ срезать затраты на инференс ChatGPT более чем вдвое.

- NotebookLM показал Short Video Overviews: вертикальные ролики в стиле TikTok из загруженных материалов.

- Cursor выпустил приложение для iOS.

- Microsoft создает AI-интегратора Frontier Company за $2.5 млрд, и AWS вкладывает $1 млрд в похожий Forward Deployed Engineering.

- Alibaba запретила сотрудникам Claude Code: в нем нашли код, определяющий, находится ли пользователь в Китае.

- Cloudflare разделит AI-краулеры на три типа (поиск, агенты, обучение): с 15 сентября обучение и агентный доступ на новых сайтах с рекламой блокируются по умолчанию, издатели смогут брать плату за контент.

- Unit 42 описала Phantom Squatting: хакеры регистрируют домены, которые галлюцинируют LLM, и жертву на фишинг приводит сама модель. Уже 13+ тысяч вредоносных URL.

- Исследование Ramp по 21 тыс компаний: интенсивные AI-траты коррелируют с ростом найма (+10%), включая джунов (+12%).

- Роботы дешевеют: UBTech показала "эмоциональных" гуманоидов от $15 тысяч , а обзор Rise of the Cheap Robots описывает волну general-purpose роботов дешевле $10 тысяч.

- DeepSeek заопенсорсил DeepSpec - стек спекулятивного ускорения инференса: в проде V4 Flash и Pro генерируют на 60-85% быстрее.

- Mistral выпустила Leanstral 1.5 (Apache 2.0) для формальной верификации: сатурировала miniF2F и нашла 5 неизвестных багов в проверенных репозиториях.

- xAI запустила Voice Agent Builder: no-code голосовые агенты на Grok по $0.05/мин.

- Tau - образовательный agent-харнесс, чтобы понять устройство агентов изнутри.

- audio.cpp - локальные аудиомодели на C++/ggml: очень оптимизировано.

- PyMuPDF 1.28 научился собирать PDF из Markdown с контролем вида через CSS - удобно для документных пайплайнов.

- Rampart - in-browser модель на 15MB, для детекции и маскировки персональныx данныx.

- Команда SGLang про то как превращает агентные workflow в переиспользуемые SKILL.md и debugging playbooks.

- WebKit выпустил Safari MCP (наконец можно ловить Safari баги агентом).

- 👍Детальный гайд по production-ready coding-агенту на полностью локальном стеке.

- 🤩 Z.ai выкатила свой агентный апп ZCode 3.0 - а-ля Codex на базе GLM (и других моделей, включая опенаи и антропик), есть управление через Telegram.

Читать полностью…

Refat Talks: Tech & AI

Запись и слайды моего доклада "Что оставить людям, что коду (workflow), что агенту".

📹 Запись: https://youtu.be/1Ps5ra13_ro?t=80
🖼 Слайды в аттаче.

Тезисно, о чем было:

- почему важно различать два режима: augmentation (человек в центре) и automation (фоновая автоматизация)

- где что ломается: люди не масштабируются, workflow негибкий, агент дорогой и ненадежный на потоке;

- кейс маркетингового агентства: augmentation работала отлично, а agentic-автоматизация все время ломалась, пока не пришли к схеме, где максимум переносим в workflow, а агент их пишет и поддерживает;

- простое правило: можешь написать чек-лист или граф - автоматизируй, думаешь каждый раз заново - оставляй человеку. И несколько мыслей о том когда выносить агентов в фоновые автоматизации.

- почему понимание сложно делегируется и роль эксперта от этого только растет;

- пара практических вещей: файлы как артефакт, SOP, делать ревью максимально удобными, единый governance вместо разрозненных трейсов;

- пример про извлечение данных из документов: стоило $11 за документ у агента и упало до <$1, когда то же самое переписали в workflow;

- про проект дата-скрейпинга, где мы ушли от LLM-экстракшена к агентной кодогенерации: агент пишет детерминированные парсеры, а не LLM парсит страницы вживую (oб этом, кстати, еще буду писать, stay tuned).

Читать полностью…

Refat Talks: Tech & AI

Новый Claude Design очень неплох!

Когда Claude Design вышел первый раз, я попробовал и он показался неюзабельным, и большого смысла в нем я не увидел.

Сейчас после их апдейта вернулся и это уже сильно лучше: дизайн-система, точечное управление компонентами, двусторонний синк с Claude Code (который мог бы быть и лучше, но ок). Завезли управление компонентами - drag/resize/align и дерево слоев. То есть он стал заметно ближе к Фигме. Улучшенный экспорт: PDF, PowerPoint, zip, HTML.

Но все еще есть баги и все еще жрет токены (хоть и сильно меньше).

В ютубе в основном обзоры Claude Design для веб-дизайна, но мне нравится как он работает со слайдами. Я уже писал про Slidev (и все еще считаю что это отличный тул), а в этот раз собрал презу в Claude Design в качестве эксперимента - и мне понравилось. Дизайн-система, интеграция с кодом и прямое редактирование сильно упростили работу, плюс есть режим презентации прямо внутри. Для такой задачи зашло отлично.

Кстати, на видео слайды моего сегодняшнего выступления, так что заодно напоминаю.

Читать полностью…

Refat Talks: Tech & AI

Ключевой управленческий выбор в эпоху AI - что оставить людям, что коду, а что агенту. Этот пост - анонс ивента Стратоплана, куда меня пригласили выступить на эту тему. Ивент (Camp) в основном для фаундеров и руководителей, бесплатно.

О чем расскажу я

- Роль доменных экспертов в AI-трансформации компании и почему автоматизация перестала быть задачей разработчика.

- Как упаковывать экспертизу и процедуры в готовые навыки для агента (и причем тут SOP).

- Лучший паттерн для фоновой автоматизации — агент пишет workflow, а не крутится в проде (с примерами из реальных проектов).

- AX (agent experience) - почему это теперь важная часть продукта.

- Как решать, что отдать агенту, что коду (workflow), а что оставить людям. Тоже с примерами.

Что еще будет?

Много полезного для фаундеров и управленцев, конференция (Camp) в основном для них, но не только.

Всего будет 4 трека:
- управленческий (для лидов и руководителей отделов)
- стратегический трек (оунеров, СЕО)
- директорский трек (для техдиров и СОО) <- я буду тут
- карьерный трек (для всех, кто хочет разобраться, как расти, когда вокруг сокращают)

И еще будут воркшопы.

--

Когда: 22-25 июня, по вечерам 18-21 по GMT+3

Участие бесплатное (нужно подписаться на каналы) или платное (если вдруг не хотите подписываться).

Регистрация здесь

Читать полностью…

Refat Talks: Tech & AI

#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- Anthropic выпустила новую модель Claude Fable 5 - подробности в посте выше.

- Через пару дней Минторг США приказал отключить Fable 5 и Mythos 5 для всех иностранцев (подозрение на jailbreak). Разделить трафик быстро нельзя, поэтому Anthropic вырубила обе модели для всех.

- Apple на WWDC показала переработанную Siri AI: на своих версиях Gemini, понимание контекста и экрана, релиз осенью (без ЕС и Китая). Также интегрировали AI в другие свои фичи.

- Google срезал цену самого дешевого AI-плана с $8 до $5 в месяц и дал вдвое больше хранилища.

- SpaceX провела крупнейшее IPO в истории: $75 млрд при оценке ~$1,8 трлн.

- Z.ai представила GLM-5.2 - флагман для агентного кодинга с 1M контекста и режимом Max-effort.

- Google выпустил Gemini 3.5 Live Translate - потоковый синхронный голосовой перевод. В Google Translate, Meet и через Live API.

- Google выложил открытую диффузионную DiffusionGemma: генерирует текст блоками, а не по токену, до 4x быстрее, качество пониже Gemma 4.

- Два эссе от лидеров индустрии: Альтман пишет про ускорение и AGI каждому, а Дарио Амодеи призывает к осторожности и FAA-подобному регулированию.

- OpenAI купила Ona - облачную оркестрацию для агентов.

- Google законтрактовал у SpaceX ~110 тыс. GPU Blackwell за $920 млн в месяц до 2029.

- OpenAI, по данным The Information, вероятно отложит IPO на 2027: объясняют это прогрессом в самообучающемся ИИ и сильными метриками Anthropic. Сотрудникам предложили выкуп акций.

- Китай строит единую национальную вычислительную сеть из дата-центров (сейчас большай фрагментация).

- ChatGPT не убил Поиск Google - он на историческом максимуме: выручка Search +19% год к году.

- Джефф Безос вышел из стелса с Prometheus и сразу поднял $12 млрд на AI инженерию для физического мира.

- Сооснователь xAI Игорь Бабушкин запустил River AI - адаптивные персонализированные агенты, костяк команды из xAI.

- Stack Overflow перезапускается под агентов.

- Cognition обещает до $10M кредитов, если Devin недоработает по годовому корпоративному контракту (прецедент гарантии b2b AI).

- Xiaomi выпустила MiMo UltraSpeed - 1-триллионную MoE со скоростью 1000+ ток/с на обычном 8-GPU сервере.

- Cohere выпустила North Mini Code - открытую coding-модель, быстрее сравнимой Devstral Small 2 в 2,8 раза.

- Moonshot выпустила Kimi K2.7-Code - открытую модель для агентного кодинга.

- Moonshot представила Kimi Work - десктопный агент, прямой ответ на Claude Cowork.

- Cognition представила FrontierCode - насколько модель тянет стандарты качественных продакшен-кодбаз. Сделан опенсорс-мейнтейнерами.

- Claude Code апдейт: субагенты могут спавнить субагентов (до 5 уровней), fallbackModel при перегрузке, /cd без сброса кеша.

- Anthropic открыла observability для MCP-коннекторов: дашборд по adoption, health, error rate и пр.

- OpenAI разрешила в Codex ограниченно откладывать сбросы лимитов про запас и активировать в удобный момент + на две недели реферальная акция: пригласи друга (до 3х) - оба получите по дополнительному сбросу лимитов.

- К ЧМ по футболу Google временно открыл всем бесплатно генеративный UI в AI Mode (обычно Pro и Ultra): на вопрос о тактике поисковик рисует интерактивные схемы.

- Google завез Colab в терминал можно скилами провижинить GPU и попросить "зафайнтюнь модель на моем датасете"

- Vercel запустил skills.sh API - запросы к коллекции 600k+ skills.

- skill-eval-harness - маленький Python-harness, чтобы прогнать evals на своих skills и понять, помогают они модели или вредят.

- text-to-lottie - открытый скилл для Claude Code и Codex, генерит production-ready Lottie-анимации по текстовому промпту.

- 🤩 NotebookLM полностью обновили: теперь это автономные агенты, работа со скиллами (100+ на каждый блокнот) и запуск кода, а под капотом Gemini 3.5 и движок Antigravity.

Читать полностью…
Subscribe to a channel