⚪️ Текущие впечатления от поколения 5.6 и флоу
Много обсуждали в чате, и, пользуясь служебным положением, резюмирую впечатления от поколения gpt моделей 5.6
Использую, как и все, наверное, Sol и Luna. Terra остаётся не у дел: не ясно зачем она нужна - расход немаленький, а качество пониже Sol.
▶️ Планирую Sol. Попытки планирования Луной не сказать чтобы провальные, но она заметно больше упускает, не так глубоко прорабатывает, и делает все сильно дольше.
Что у Sol хорошо: он действительно может глубоко проработать. High / Xhigh ризонинга мне хватало. Max / Ultra практически не включал, смысла не вижу.
Что у Sol плохо: мощная тяга все усложнять. Без промптинга на жёсткое упрощение навыком Ponytail/аналогами все время получаем космолёт. И в предыдущих поколениях такое было - но сейчас это правило усложнить на ровном месте . Снижение ризонинга помогает слабо и заметно слабее проработка деталей - поэтому приходится спасаться промпингом.
Что ещё плохо: лимиты Sol просто кушает. Кодинг на Sol по качетсву ок, времени мало занимает, пишет сразу все хорошо, но даже на Medium/Low лимиты тают
▶️ Что у Луны хорошо: лимиты практически не кончаются. Я уже и количество подписко в пуле снизил (пока на четверть), потому что у меня остались лимиты при текущей загрузке! Думаю, с таким расходом можно повышать использование, больше проектов одновременно и больше сессий. Надо добивать облачный оркестратор.
Что у Луны ещё хорошо: она, в принципе, недурственно справляется со всеми конкретно поставленными задачами.
Что у Луны плохо: она не так внимательна, как Sol. Может что-то упускать. Спасает ревью.
Что ещё у Луны плохо: скорость. Модель не особо летает, и думает она медленно, токенов на max тратит немало.
Что ещё у Луны плохо: если встретилась проблема в протоколе (что то не учли заранее или прописали так, что остаётся люфт) - может под goal очень и очень долго ходить кругами и предлагать ерунду вместо решения проблемы. За долгими сессиями надо следить - благо сейчас /side во время сессии позволяет получить справку чего там происходит, что сделано, что не сделано, какие проблемы.
▶️ Насчёт флоу: не могу нащупать баланс - рельсовые флоу получаются очень долго все прорабатывают, могут крутится часами. Качество, конечно, хорошее - но оптимизации затруднены. Попытки делать роутинг простых задач в более простой флоу автоматически приводят к тому, что модели часто видят ситуацию сложнее, чем оно того стоит, в итоге выбирая более тяжёлые флоу чем я бы выбрал "руками" и чем оно того стоит. Не уверен в том, как это чинить - вроде бы упрощать флоу не хочется, для сложных вопросов оно такое надо, но проблему траты кучи времёни надо решать. Пока склоняюсь к созданию облачного оркестратора и работе просто с большим количеством параллельных сессий.
Интерактивные сессии с простыми вручную вызываемыми скиллами - тоже вариант, но чтобы получилось качественно, надо много руками дёргать скиллов/субагентов. Без проработки скиллами/субагентами на проектах крупнее 30-50к loc уже получается слоп.
▶️ В целом, я скорее за рельсовые флоу по мотивам SDD / TDD/ BDD, но надо придумывать как бороть их недостаток: очень "тяжелые". Уже разные оптимизации придумываю, всякий роутинг автоматический, всякий вариант не фокусными агентами делать, а группировать в субагентов аспекты пачками. Есть ещё одна задумка: дорабатывать фичи более лёгким флоу, с последующей глубокой проработкой рефакторингом в фоновом режиме (ночью, в облаке, например) - но это все упирается в слабую способность моделей пилить качественную и простую архитектуру. Надежда на астру в этом плане - нужна не оверинжиниринг в моделях, а сеньёрность, умение сделать максимально просто но с полным функционалом. Ponytail это пробует зафорсить, становится лучше, но здравого смысла к сожалению, добавить не всегда может. Возможно, секрет в нескольких агентах и их коллаборации по таким вопросам. Вопрос требует исследований и экспериментов - делитесь если кто то туда же думает.
👉 Примерно так. Можно спрашивать если что то развернуть или невнятно описал.
@deksden_notes
не одним codex единым!
неделю назад решил попробовать китайские модельки (чтоб быть готовым в случае если америкосы обрежут доступы к кодексу и клоду)
взял opencode go за $5 (последующие месяцы по $10) и сейчас уже пришлось взять второй аккаунт, потому что лимиты кончились емое!
короче, китайцы прям шикарны
я сейчас работаю в основном с minimax m3 - выбрал потому что она из немногих поддерживает картинки на вход. а еще ее рекламировали как полная копия клода
до kimi k3 пока ещё не дошел, боюсь что лимиты улетят очень быстро
пробую применять свой planact на китайских модельках, пока что вроде всё ок работает.
с виду - качество кода тоже ок
а вы используете китайцев? какие модели посоветуете? какие подписки самые выгодные сейчас?
friendly reminder для тех, кто планировал приобрести курс.
старт уже скоро – в следующий понедельник, 10 августа.
первый групповой созвон будет 11 августа, во вторник.
если вы откладывали покупку курса, то лучше это сделать сегодня!
В AI индустрии всё меняется каждый месяц
В чатах по AI время от времени вижу от новичков запрос: "посоветуйте курс по AI". В ответ, народ часто говорит, что нормальных курсов сейчас нет, потому что сейчас всё быстро меняется в индустрии и быстро становится неактуальным, так что, мол, зря потратите деньги!
Я с этим не согласен и не просто потому что я сам продаю курс по AI Coding 🙂
Дело в том, что фундаментальные знания о том, как устроена LLM, как с ней работать, никогда не устареют.
А именно на этих знаниях строится всё остальное.
Это как в школе – если в 6 классе вы прогуляли умножение/деление, то дальше будет тяжело, потому что весь остальной материал отстраивается от этих знаний.
И скипнуть эти знания не получится никак.
Так и в курсах по AI (в том числе у меня 🙄).
Без знаний о том, как работает контекст, attention, feedback loop, вам будет тяжело.
Вы не сможете собрать новый, свой, фреймворк Plan & Act или модифицировать мой.
Не сможете собрать эффективный skill для реализации code review.
Да, вроде бы, понимание, как работает LLM (не уходя в математику) это не rocket science, но вот что ещё полезного есть обычно в курсах (ну, у меня точно, я же практик) – это практический опыт автора.
Я работаю с LLM с конца 2022 года и за это время успел попробовать много разных инструментов и подходов. Успел набить шишки и набраться опыта, чтобы смочь вам подсказать:
• "фрактальные промпты" это какой то буллщит
• использование XML в промптах в актуальных SotA моделях не даст вам никаких преимуществ
• промпты вы можете писать как на русском, так и на английском, французском, монгольском, китайском или хинди – выбирайте любой, на котором вам удобнее излагать свои мысли. Современная SotA LLM любой язык поймёт, а экономить на спичках (токенах) не считаю нужным.
И вот такие инсайты удобнее всего слушать и смотреть с дополнительным контекстом вокруг этих инсайтов – с понятными примерами, картинками, схемами.
Курсы, обычно, призваны экономить ваше время.
За деньги вы покупаете возможность не тратить на это всё месяца хождения кругами, получаете структурированную информацию и правильный путь по изучению AI Coding.
Лайк, репост,
✔️ Тимур Хахалев про AI Coding, подписывайтесь!
Исследование практики AI Coding в компаниях
Последний раз такое исследование я проводил более полугода назад, с тех пор прошло много времени и многое поменялось. Так что стало интересно провести такое исследование опять.
• Вы "чемпион" по AI Coding в вашей компании или новичок? А ваши коллеги?
• Какими достижениями можете похвастаться? А что бесит больше всего?
• Ваша компания поддерживает развитие? Или ставит палки в колёса?
Пройдите опрос и помогите понять реальное положение дел в компаниях (в РФ и зарубежных).
А спустя время я обязательно поделюсь результатами здесь у себя на канале
Пройти опрос
И не забудьте репостнуть этот опрос вашим друзьям, чтобы у нас получилось собрать ещё больше информации.
Лайк, репост,
✔️ Тимур Хахалев про AI Coding, подписывайтесь!
Хроники ИИ-трансформации в РФ. Разбор
Пару недель назад я рассказывал о том, как идёт ИИ-трансформация в одной российской компании
В комментах мнения о том, насколько всё хорошо или плохо разделились.
А я бы хотел разобрать эту ситуацию и рассказать, что плохого или хорошего по моему мнению там происходит.
Во-первых, т. к. мы с вами находимся в ИИ-пузыре, то ИИ-трансформация это, конечно же, хорошо.
Но плохо то, как именно она проводится.
Я считаю, что нельзя – просто взять и всучить в зубы всем подписки клода нужно подписки чатгпт и сказать, что с сегодняшнего дня ты теперь програмироваешь.
Нет, так работать не будет.
- большинству людей не нравится менять свой флоу работы просто потому что так решил Кабан Кабаныч
- за пределами нашего с вами пузыря есть много людей, которые отрицательно относятся к ИИ и трансформациям у себя в компании
- я несколько раз уточнял и знаю, что в этой компании руководитель не позаботился провести обучение персонала.
А как мы с вами помним, по прошлогоднему исследованию METR, эффективность неподготовленный человека к AI инструментам снижается на 19%
В итоге, как эту ситуацию видит подчинённый?
- вокруг в соц. медиа много говорят о том, что ИИ это фигня, много ошибается и за ним нужно всё переделывать
- руководитель ставит перед фактом – либо ты используешь новые инструменты в своей работе, либо идёшь на мороз. Даже если руководитель напрямую так не говорит, об этом говорит общество вокруг.
- какое нафиг обучение, если я уже и так обучился, когда залетал в айтишечку? У меня дома дети, жена, ипотека. На обучение времени нет. Деньги тратить на это тоже не очень хочу. А не пошёл бы Кабан Кабаныч нафиг? Буду саботировать работу и подыскивать место, где ИИ трансформации ещё нет.
А как делать правильно?
Чтобы такая трансформация сработала, необходимо, чтобы народ сам загорелся и захотел освоить новые инструменты, а руководство поддержало бы сверху.
Как это сделать?
Например, показать, как можно выполнять их работу используя новые инструменты и какие преимущества им это может дать.
А потом уже уходить в детали, заняться безопасностью, подготавливать правильную инфраструктуру под ваши задачи, создавать скиллы, агентов и т. д.
Ещё круто будет, если в компании уже будут "чемпионы", которые сами смогли обучиться и используют новые инструменты на полную.
Таких людей нужно поддерживать, чтобы они распространяли эту свою "вайбкодинговую заразу" на коллег.
Тут ещё важно сказать, что такие чемпионы обычно самоучки и могут пропускать самое неинтересное (про безопасность, надёжность и вот это всё) и для них стоило бы проводить точечное обучение, чтобы закрывать пробелы в знаниях и не огрести проблем в будущем.
При этом, конечно, всё ещё будут люди которым эта ИИ трансформация не нужна и им просто не интересно напрягаться ещё даже за дополнительную премию.
Что с такими делать?
Тут решение за вами, но прежде чем переходить к этому этапу, нужно чтобы у человека был шанс обучиться новым инструментам за ваш счёт.
Экономить на этом и пытаться обучить вашего сотрудника новому инструменту за его счёт попахивает редфлагом среди ваших следующих соискателей.
Я тут недавно прикинул и понял, что обучение на несколько команд, в пересчёте на одного сотрудника, стоит точно дешевле нового макбука в 4-5 раз – от 40 тыс руб.
При этом, это кастомное обучение, заточенное под задачи команд.
И вот, пока народ в руководстве не примет тот факт, что ИИ трансформация не бесплатная и платить необходимо не только за токены и подписки, такие истории будут повторяться.
Лайк, репост,
✔️ Тимур Хахалев про AI Coding, подписывайтесь!
Способ ответа на вопросы в Codex App
Рекомендую :)
кстати, можно ещё и голосом надиктовывать заметки
подсмотрел у @etechlead
Лайк, репост,
✔️ Тимур Хахалев про AI Coding, подписывайтесь!
Кажется, мы недостаточно сильно не любим Anthropic))
Тут в X разгорелся очередной скандал вокруг этой организации: выяснилось, что Anthropic закупали бумажные книги миллионами штук (в т. ч. достаточно редкие), сканили их и уничтожали.
Попытался разобраться что там произошло и написал статью на Хабр
https://habr.com/ru/articles/1063878/
Лайк, репост
✔️ Тимур Хахалев про AI Coding, подписывайтесь!
Стрим!
Разберём Telegram Desktop репо со стороны AI Coding: узнаем, как выстроили свою работу разработчики этого приложения. Какие у этого подхода есть плюсы и минусы.
Сегодня, в 18:30 по МСК
📱 https://youtube.com/live/J1zUMZqEv84?feature=share
Ещё один крутой кейс применения ChatGPT Automations
Mitchell Hashimoto, создатель Ghostty и сооснователь HashiCorp, рассказал недавно в X, как сэкономил около $45K с помощью автоматизации в ChatGPT (Codex).
Он дал агенту доступ к почте в режиме read-only и поручил проверять счета от строительных подрядчиков. У агента был контекст по проектам: предыдущие счета, переписка, заметки со встреч и другие документы.
Каждый раз, когда на почту приходит новый счёт, ChatGPT анализирует его и отправляет Mitchell отчёт.
Он получает несколько таких счетов в месяц, а каждый из них — это примерно 50 страниц плохо отсканированных PDF.
Агент подняла историю за три года и нашёл проблем примерно на $45K:
• где-то были указаны неправильные суммы
• какие-то счета выставили повторно
• часть вообще была адресована другому человеку
Mitchell вручную перепроверил каждый случай, написал подрядчикам и получил возвраты либо зачёт в счёт будущих платежей.
За всё время на ChatGPT он потратил около $1 800. Получается, одна автоматизация уже окупила эти расходы в 25 раз.
Лайк, репост
✔️ Тимур Хахалев про AI Coding, подписывайтесь!
на случай, если на меня подписаны инвесторы:
тут ребята которых я знаю лично @neuraldeep и @gleb_pro_ai заколлабились и поднимают инвестиции на железках в европе!
если интересно - велкам
/channel/gleb_pro_ai/684
кстати, тут в комментах народ жалуется на разные баги отображения rich text editor в клиентах.
я уже сам настрадался с реализацией олимпиадников, так что понимаю вас.
тут кстате недавно в гитхаб репо telegram desktop были обнаружены артефакты ai coding
если этот пост соберет достаточное количество лайков, сделаю разбор репо и скажу, что с ним ок, а что не ок
AI Coding для Разрабов, Season 2
Старт продаж 2-го потока моего курса открыт!
Первый поток прошло уже 70+ человек.
Кому не подойдёт?
- тем, у кого нет опыта в разработке
Кому подойдёт?
- разработчикам
- которые хотя бы 1-2 раза открывали AI инструменты
Цель курса — научить вас использовать AI Coding на профессиональном уровне
Формат:
- 1-й видеоурок доступен прямо сейчас, остальные 6 выйдут в один день, 10 августа
- в видеоуроках лекция и практика
- в течение 6 недель будем созваниваться в группе и разбирать домашки (доступно на некоторых тарифах)
Что вы получите после прохождения курса?
- Системное понимание, как правильно использовать AI Coding, чтобы решать задачи в разработке
- Понимание, как решать типичные возникающие проблемы с AI Coding (галлюцинации, несоблюдение инструкций, расползание проекта и прочие)
- Plan & Act skill и другие скиллы, которые я использую в своей работе каждый день
Главные детали:
- старт 10 августа
- количество мест ограничено
Остальные детали есть на сайте, по кнопке ниже.
OpenAI AMA (Ask Me Anything) Reddit ч. 2
ч. 1 тут
Скорость, контекстное окно и persistence
• Если 5.6 кажется медленнее, возможно, пользователю не нужен тот же уровень reasoning, что и с 5.5. Sol Medium быстрее 5.5 для большинства задач. Fast mode работает примерно в 1.5 раза быстрее. Скоро Sol будет работать на Cerebras со скоростью около 750 токенов в секунду.
• По 1M context window для Sol обещаний нет. Команда сказала, что compaction довольно неплохо работает для длинных тредов, и они внимательнее посмотрят на фидбек по long-context.
• Codex лучше давать ограниченные цели, но с пространством для глубокого рассуждения, а не позволять ему преждевременно заключить, что что-то невозможно.
Бенчмарки, безопасность и исследовательская культура
• По отчёту METR о reward hacking команда сказала, что активно проверяет и штрафует cheating во время evals, чтобы результаты отражали настоящие capability, а не решение задач вне духа eval. Также они используют сторонних vendors для независимого запуска бенчмарков.
• Команда отрицает, что перед релизами модели «лоботомизируют». Iterative deployment означает, что core capabilities выкладываются как есть, но с guardrails против злоупотреблений.
• Sol дообучал Luna. Исследователи теперь работают на более высоком уровне абстракции, используя несколько параллельных Codex-тредов, которые круглосуточно валидируют гипотезы.
Лайк, репост
✔️ Тимур Хахалев про AI Coding, подписывайтесь!
Безопасный запуск команд в агентах
Тут на прошлой неделе один инфлюенсер столкнулся с проблемой – GPT 5.6 Sol удалил папку ~/ на маке!
Ну и дела!
В реплаях ему посоветовали использовать dcg (destructive command guard).
Я посмотрел что это, разобрался в нём, установил себе и теперь рекомендую вам!
Это инструмент, который блокирует деструктивные команды, которые "случайно" мог ввести AI-агент.
Устанавливается как hook во все популярные агенты и блокирует запуск большинства команд.
Удобно, что устанавливается одной командой, а так же то, что тут есть набор конфигов по софту:
• git
• filesystem
• disk
• storage (s3, minio)
• remote (rsync, ssh, scp)
• database (pg, mongo, etc)
• container (docker, kuber, podman)
• и многие другие
Важно понимать, что этот инструмент спасает именно от "случайных" команд - тех случаев, когда что-то идёт не так, и агент вводит команду, которую изначально не планировал, а потом оправдывается, что это произошло случайно!
Этот инструмент не поможет, когда агент создаст деструктивную команду в скрипте и запустит его.
В комментах скину таблицу, которую составил мой Codex – какие результаты получат типичные сценарии
Лайк, репост
✔️ Тимур Хахалев про AI Coding, подписывайтесь!
Подборка постов моего канала
За последнее время на канале вышло много материалов про практический AI Coding. Собрал мои любимые посты на случай, если вы что-то пропустили.
• Почему AI Coding требует подготовки и системного подхода — почему одного доступа к хорошей модели недостаточно для получения надёжного результата.
• Почему Codex стал моим инструментом на каждый день — мой опыт перехода на Codex и задачи, для которых я его использую.
• Как я использую Chrome DevTools MCP для E2E-тестов — как хранить пользовательские сценарии в репозитории и проверять фронтенд с помощью AI.
• Как Anthropic организует выполнение длительных задач по кодингу — про harness для долгих задач, сохранение прогресса и управление контекстом.
• CLI Creator Skill — инструмент для создания качественных CLI-приложений с помощью Codex.
• Что такое Skills и как их использовать — хорошее объяснение механики Skills и их роли в работе AI-агентов.
• Фишки Codex, о которых вы могли не знать — несколько неочевидных возможностей Codex, которые упрощают ежедневную работу.
• Безопасный запуск команд в AI-агентах — как защититься от случайного запуска деструктивных команд.
• Четыре совета по работе с AI — практические выводы из моего собственного опыта работы с AI.
Сохраняйте подборку и пересылайте коллегам, которые только начинают погружаться в AI Coding.
#posts_collection@the_ai_architect
Лайк, репост,
✔️ Тимур Хахалев про AI Coding, подписывайтесь!
я тут недавно стартовал исследование зрелости ai coding в компаниях. результатов пока не много, но вот что заинтересовало.
достаточное количество людей отметили, что у них в компаниях есть инфраструктура для ai агентов, чтобы они могли решать задачи
мне стало интересно: как у вас выглядит такая инфраструктура и какие задачи с помощью нее выполняются? как она реализована? это один единый api backend к которому подключаются агенты по api/mcp получают/мутируют данные?
как у вас выглядят агенты?
гоу хвастаться в комментах! 👇
Вы не раз говорили про ответственность разработчика, код ревью, что это важно при работе с агентами.
Но ничего не говорили про само качество кода, безопасность.
Ощущение, что качество решения, паттерны разработки уходят на второй план, а в первую очередь главное доставить фичи, это так?
Делаю задачи автономно в Codex – Plan & Act
Выкладываю запись вчерашнего стрима. В конце ещё дозаписал результат который получился.
Приятного просмотра!
https://www.youtube.com/watch?v=P6W5NwIHxvM
Лайк, репост,
✔️ Тимур Хахалев про AI Coding, подписывайтесь!
#полезное
Постоянный канал с вакансиями для AI-инженеров
/channel/ai_engineer_jobs. Туда автоматически летят вакансии для AI Engineer, LLM Engineer, Agent Engineer, AI Product Engineer, vibe coder и других около-AI ролей. Сейчас подключено 22 источника -> чуть позже будет 400+
Поддерживает Telegram, RSS, API, карьерные сайты и вообще любые источники, которые удастся обнаружить и распарсить. Также содержит продвинутый набор инструментов обходов блокировок и защит от парсинга (исключая LinkedIn, там особый случай)
За всем этим стоит написанный мной монстр job_ftch -> ETL-пайплайн с автодискавери источников, парсингом, дедупликацией и ML+LLM фильтрацией
В общем, кому нужны нормальные вакансии в AI без тонны мусора -> подписывайтесь. Также вы можете сделать свой сервис/MCP/телеграм бот из этого проекта, так как он универсальный
вчера у меня появилась идея сделать свой собственный велосипед – развернуть проект который будет являться сокращалкой ссылок с возможностью накопления аналитики по переходам.
проект должен быть очень простым, я уже сделал foundation и наметил что именно нужно сделать, так что осталось самое вкусное - реализовать круды, джсоны переложить, да ui покрутить.
решил, что это хороший способ показать мой Plan&Act подход на практике и вообще показать как я работаю.
короче, будет стрим на ютубе, в пт, 31 июля, 18:15 по МСК.
тут можно нажать напоминалку
https://youtube.com/live/YOqFKLDaBKM?feature=share
Как разрабы Telegram Desktop используют Codex и Claude Code в своей работе и какие ошибки допустили
запись вчерашнего стрима.
предупреждаю: тут душно! контент для тех, кто реально хочет разбираться в ai coding
https://youtube.com/live/J1zUMZqEv84
Как сохранить баланс между сжиганием токенов и и выстраиванием типового воркфлоу с агентами?
я на Selectel Day off
буду выступать в 12:00, потом еще в 14:00 у меня воркшоп
кто тут будет - подходите
для тех кто был на выступлении: ссылка на чеклист
про agentic interface
для операционки вокруг курса у меня есть, как минимум, два проекта: один это кастомный CRM вокруг моего тг канала и тг бота. второй это CRM для моих курсов/воркшопов (по научному называется LMS).
так как со всем этим работаю только я сам, то на проработку UI/UX обычно выделяется очень мало времени (да и опыта с этим не так много), что ведёт к невообразимо сложным интерфейсам!) сам SAP позавидует.
но операционные задачи выполнять нужно, так что приходится страдать.
спустя какое-то время я понял, что на самом деле, удобнее было бы делать это агентом - я ему объясняю, чего надо сделать, а он подключается к системе и своими лапками выполняет действия.
сказано - сделано, ещё весной. поигрался и отчасти забыл, потому что по старой памяти возвращался делать некоторые задачи руками.
а при подготовке нового потока курса понял, что некоторые задачи прям невыносимо нудно делать (на самом деле тут нужно было потратить минут 40), поэтому делегирую это агенту!
короче, пошёл собирать инструмент.
вместе с агентом собрали имеющиеся сущности, операционные сценарии и сделали таблицу по пермишенам - какие задачи агент может делать спокойно, на каких нужно подтверждение, а какие делать нельзя. то что нельзя - закрыли пермишеннами в коде. то, где агенту нужно подтверждение - он запросит его у меня (да, никаких гардрейлов тут нет, решил с этим не заморачиваться, потому что gpt 5.6 следует инструкциям максимально дотошно)
далее, на всё это дело сделали cli + skill.
на всякий случай уточню - cli взаимодействует с платформой по классическому rest api со своей авторизацией. У юзера этого cli есть своя роль, у которой есть уровни доступа.
теперь для задач уровня: "а сколько пользователей у нас посмотрели все видеоуроки?", "а откуда пришёл этот пользователь *id*?", "сколько оплат на тарифе *тариф*?"
агент запускает один из skill (или сразу два), использует cli и отвечает на мои вопросы, или делает экшены, типа "в этом уроке необходимо поменять параметр *параметр1*, *параметр2*".
в будущем, я считаю, все такие админские интерфейсы стоит в первую очередь проектировать под агента, а потом уже под человека.
с таким подходом ваш проект точно можно будет называть ai native!) вот кстати *ндекс делает похожим образом, комментировал это тут
лайк, репост
✔️ Тимур Хахалев про AI Coding, подписывайтесь!
Как переехать с Wispr Flow в Codex App?
И при этом перенести словарь с наработанными фразами.
Очень просто!
За наводку спасибо Jason Liu.
Кстати, про остальные его лайфхаки по работе с Codex я уже писал тут.
Wispr Flow хранит свой словарь в SQLite database на macOS тут:
~/Library/Application Support/Wispr Flow/flow.sqlite
dictationDictionary полем в config.toml
на случай, если вы ещё не обновляли клиент телеги, сообщаю 😁
я тут рассказываю о том, что у меня открывается второй поток курса AI Coding для разрабов. детали тут
Пятничное. Хроники российской ИИ-трансформации
Подсмотрел в одном чате, немного отредактировал формулировки, так как я на канале не матерюсь.
Без ссылок, имен и названий компаний.
- все было прекрасно, а потом директор попробовал Клод и подсел. Выдал всем по $100-$200 аккаунты. Дают по куче задач одновременно, под конец дня мозг в коме
- за месяц все проджекты резко стали продуктовыми инженерами (что это значит, никто не сказал)
- половину разработки и тестеров уволили, развалили весь процесс
- у нас онпермис продукт. Его разворачивают в закрытых контурах клиентов.
- весь продукт с джавы переписывают на раст. Клодом
- "вы среди первых проходите аи трансформацию в России. Вы должны сутра быть счастливы от этой мысли"
- маркетологам сказали, что они тоже теперь могут все рабочие сайты делать сами, программисты им больше не нужны
- директор общается в переписках исключительно нейрослопом, от которого уже тошнит
---
вопрос аудитории, что руководство сделало не так и как нужно было делать правильно?
Лайк, репост
✔️ Тимур Хахалев про AI Coding, подписывайтесь!
кстати, к теме harness
тут в X рассказали про способ рефлексии для агентов – papercuts.
После того как агенты сталкиваются с какими-нибудь проблемами (например, не правильный набор флагов для shell команды или не правильный путь к документации), они должны отрефлексировать это и описать эти проблемы в файле PAPERCUTS.md.
По этому файлу затем можно понять, с какими проблемами агент обычно сталкивается и постараться их исправить.
Очень полезно!
Думаю, в harness будущего такое будет развиваться ещё сильнее, про это тоже поговорим на стриме!
А промпт для такого подхода к рефлексии можно забрать у Игоря @tips_ai.
Про эту новость я узнал у него же. Так что если вам тоже интересно следить за разными фишечками для AI агентов, то обязательно подписывайтесь на его канал!
Лайк, репост
✔️ Тимур Хахалев про AI Coding, подписывайтесь!
Команда OpenAI провела AMA (Ask me Anything) на Reddit по случаю большого релиза GPT-5.6
Tibor Blaho суммаризировал, а я выбрал из этого самое интересное, ч. 1
Выбор модели и уровни рассуждения
• Sol Medium — для большинства задач, Sol Ultra — для действительно сложных задач, Terra — для быстрых не-кодинговых задач или когда важно экономить лимиты, при этом на некоторых задачах Terra конкурентен с GPT-5.5 при меньшей стоимости, а Luna — для сабагентов.
• Для крошечных правок, быстрых вопросов и чистки документации лучше использовать лёгкую модель с низким уровнем рассуждения. Обычный Sol Medium — для небольших багов с понятным воспроизведением. Sol с более высоким уровнем рассуждения — для неоднозначных багов, незнакомых репозиториев и сквозных рефакторингов. Sol Ultra High с планом, верификацией и тестами — для миграций, security-sensitive изменений, продакшен-инцидентов и всего, где ошибка дорого стоит.
• Сейчас нет модели «Auto», но GPT-5.6 старается сам не переосмыслять простые задачи. Новый слайдер в приложении и вебе мапит большинство уровней на reasoning effort модели Sol, а на самом низком effort откатывается на Terra. Команда согласна, что пользователи не должны становиться экспертами по роутингу моделей, но при этом хочет оставить явный override, потому что терпимость к задержке зависит от человека и конкретного момента.
- Для UI-задач лучше всего подходит Sol, особенно если дать reference images. Улучшение UI-дизайна во фронтенд-разработке было одной из целей 5.6. Использовать 5.5 имеет смысл только если твои инструкции были специально под неё заточены.
Скорость, контекстное окно и persistence
- Модель может слишком быстро сдаться и откатить целые патчи, если результат неидеален. В отличие от неё, Fable пытается исправить плохой патч. Команда сказала, что /goal помогает сделать агента более настойчивым. Улучшения persistence и снижение сложности кода запланированы. Также они предложили попробовать 5.6 Sol с High reasoning.
- Для долгих research-задач и работы через /goal пример структуры такой: широко исследовать, но узко исполнять; попробовать заданное количество гипотез; после каждой попытки запускать тесты; затем остановиться и отчитаться, чему удалось научиться и какой следующий лучший эксперимент.
Лимиты использования и цены
- Agentic usage считается по используемой функции, а не по типу клиента. Поэтому Codex везде — в приложении, CLI, IDE, вебе, мобильном клиенте и ChatGPT Work – расходуют agentic bucket. Обычные чаты в ChatGPT его не расходуют. Генерация изображений, загрузка файлов и голос имеют отдельные лимиты.
- Для MCP-heavy workflows, которые быстро сжигают лимиты, например в Unreal Engine, совет такой: завернуть MCP в CLI со skill’ом или создать кастомного сабагента с этим MCP в конфиге на более низком уровне reasoning.
Лайк, репост
✔️ Тимур Хахалев про AI Coding, подписывайтесь!