Помимо всего прочего, в 5.6 sol что-то поменяли в механизме компакта.
Случай только что:
— написал задачу в треде
— запустился компакт
— агент отрапортовал заново о завершенных задачах, полностью забив на новую
То есть буквально компакт обнулил ему свежую инструкцию. Пришлось отдельно спрашивать забыл ли он ее (да), и делать заново.
Не знаю чего там наворотили, но работает иначе чем на 5.5. и нифига не нормально 😡
За прошлую неделю я потратил 4 ресета на 200-баксовой подписке кодекса. И, короче, скажу следующее — sol в кодексе неюзабелен. По крайней мере то, что я могу сказать про max ризонинг.
Да, иногда гениально фиксит баги. И он сделал мой жесткий бенчмарк, сумев продвинуть кодовую базу с мертвой точки.
Но он тратит просто чудовищное количество токенов на тривиальщину. По сути я просто не могу поручить ему задачу, не сыграв в русскую рулетку «потратим ли мы на попытку написать простейший функционал недельный лимит за день или нет?»
Тысяч баксов в месяц на такие развлечения у меня нет, поэтому я принял решение откатиться на 5.5 xhigh, а для сложных вещей взять за основу kimi. Мне очень сильно кажется, что это будет в ближайшее время моя основная модель.
Если вам интересно просто читать новости про ИИ — это не сюда
Я каждый день пишу код, собираю агентов и пайплайны и разворачиваю модели. Щупаю технологии руками, пробую их на реальных задачах, и пишу о своем опыте.
Кто я
Меня зовут Глеб Кудрявцев. Больше 15 лет делаю IT-продукты. Семь лет был CPO в Skyeng и Skyeng Kids, потом — CPO в Joompay.
Уйдя из корпораций, запустил CareerFactory (в пике более 5 000 клиентов, делали проекты по найму для Яндекса, Авито, Tilda, DaData, и многих других). Только для Авито в 2024 году мы наняли больше сотни продактов.
Что строю сейчас
— Свою AI-лабораторию: продукты, исследования, курсы и B2B.
— SotaOCR — сервис распознавания документов.
— NeuralDeep — AI-инфраструктура и прикладные продукты на собственном инференсе
— Системы по анализу изображений и строительных чертежей.
В B2B мы решаем задачи бизнеса с помощью ИИ: вытаскиваем данные из документов и чертежей, анализируем видео с камер и звонки, прикручиваем синтез речи, внедряем AI-кодинг и поднимаем локальные модели.
А ещё я учу тому, чем пользуюсь сам: от вайбкодинга до сборки рабочих AI-пайплайнов и продуктового маркетинга.
С чего начать
— Почему агентские пайплайны сложны даже для тех, кто их строит
— Почему AI-разработка — это инженерия, а не волшебная кнопка
— Как AI-пайплайн нашёл ошибку в строительной документации
— Как и зачем я запустил SotaOCR
— Почему в этом канале не будет нейрослопа
Мои продукты, обучение и B2B-услуги живут здесь — glebkudr.com.
В общем, если вам нужен не хайп вокруг ИИ, а реальный опыт человека, который каждый день варится в этом и собирает продукты своими руками — подписывайтесь.
Иногда здесь используется сложная лексика, но я именно так и разговариваю 🙂
Здесь бывает сложно, зато честно и по делу.
Kimi снова расчехили продажу аккаунтов, налетайте.
По рефке бонус мне и вам. Нужно в течение 3х часов от перехода зарегаться, скачать их аппку и авторизоваться (даже денег заносить не надо).
Тогда мне и вам дадут лотерейный билетик на халявную подписку.
Себе взял план за $99, гоняю модель K3 как ревьюера к солу, о результатах доложусь.
Порвали личку, спасибо за реакцию, отвечу всем как смогу 👌
Читать полностью…
Если вы горите с того насколько 5.6 работает медленно, и при этом выжирает лимиты — держите лайфхак. Откатился на 5.5. xhigh и все летает 😁 Алтман что-то разочаровывает своими подкрутками, за два дня улетело два ресета. И это на тарифе за 200 баксов. Такое ощущение что лимиты опустили раз в пять.
Жду когда кими восстановят продажи.
Попробовал новую голосовую модель от Опенай. Впечатления двоякие.
1) На низком пинге она вклинивается фразами в твои рассуждения и сбивает с мысли. БЕСИТ.
2) Говорит с английским акцентом. Причем немножко карикатурным, как в фильме Брат-2. Тоже бесит.
Но за рулем поболтать удобно — для этого пожалуй формат идеален.
Устал от агентов. Помогает выпить пива или кофе, тогда язык развязывается и готов им втирать дичь.
Можно утром кофе, а вечером пива.
А еще открытие года прям — агенты гораздо лучше делают, если 10 минут нести им голосом ахинею, вместо того чтобы закинуть сто страниц четкого ТЗ. Не знаю как это работает, просто факт.
Но долго в таком режиме конечно не протянуть. Надо что-то с этим делать 😁 А у вас какие лайфхаки?
Я знаю, вы обожаете моих партнеров smartaipack.ru
Многие через них брали подписки, пока это работало. Сейчас работать перестало (баны), но товарищи нашли новую имбу.
Дешевые токены. Аттракцион невиданной щедрости в т.ч. на топовые модели.
Вот что предлагают
====
• Цена на топовые модели в 3 раза дешевле, чем в ОпенРоутер
• OpenAI-совместимые ендпоинты chat/completions и /responses (вторую версию мало кто поддерживает в принципе из роутеров в РФ)
• Поддержка нативного клиента Антропик SDK – /messages . Мало какой роутер в РФ такое умеет, кроме того же Опенроутера.
• Оплата картой РФ или по счёту от юр.лица с необходимыми документами и ЭДО
• Сейчас доступны модели ОпенАи и Антропиоков. Скоро будут z.ai, плюс ембидинг и реранг для RAG пайплайнов. Так же будет поддержка voice-2-text и наоборот.
====
Если нужен оф. апи, то тоже могут организовать. Не в три раза дешевле, но вы это думаю и сами понимаете. Но с официальной оплатой и всем таким.
В общем, не щелкайте клювом, и берите, пока есть 🙂
Помните я говорил о совершенно жестком алго-бенче где надо планету разрушаемую сделать?
Так вот, 5.6 max ее прошел, первым среди всех моделек. Это не бенч уровня "нарисуй пеликана". Реально сложный 3d движок с нуля. Промпт не один, это итеративно дорабатывалось по много часов, в сумме часов 20 работы агента.
И анимации может нормально склеивать покадровые — там где у 5.5 проблемы были. В общем, возможности очень сильно выросли.
Поймал себя на том, что мне перестают быть нужны кнопочки и всякие ui. Просто говорю задачу, а кодекс делает. Необходимость поддерживать кнопочки ощущается анахронизмом.
На одном из проектов нужен таск трекер. Сказал агенту «найди и разверни мне решение». Глазами смотреть не собираюсь, на это тоже есть агент (и даже с глазами). И уж тем более не собираюсь использовать трелло с ноушеном.
Какой-то сдвиг происходит в сознании. Чувствуете то же самое?
Меня тут пацаны позвали потусить на митапе про AI кодинг в августе. Уже заготовил туда отборных набросов. В ответ пиарю их бесплатный митап 14 июля, то есть уже в этот вторник.
Слово Эдгару, который организует движуху:
===
Меня зовут Эдгар Сипки, я инженер и практик AI разработки.
14 июля у нас будет бесплатный митап "AI-агент в реальной разработке: как дать задачу и не потерять контроль". Думаю, зайдет тем, кто уже пробовал Claude Code / Cursor / Codex на реальном проекте и понял, что демку оно пишет бодро, а принимать этот код потом иногда страшновато.
Рега тут: https://sipkitech.timepad.ru/event/4011874/
===
Ну а в августе поговорим про TDD и большие кодовые базы, анонс будет отдельно.
Докладываюсь по результатам ночи и дня.
5.6 Sol в Max режиме таки вывозит производительность и физику. Медленно и со скрипом, но осиливает. Явно жопочасами, потому что в модель завезли способность хреначить очень долго. Тыкается, мыкается, но движется вперед, чего с предыдущими поколениями не наблюдалось. Упирались в стену и все.
Писали, дескать, оно может модельку самостоятельно натренировать. В принципе да, верю. Не тупой & старательный — сильное сочетание. Старательности завезли с головой.
Случайно наткнулся на детекторы ИИ текстов от Яндекса и от Сбера
Закинул туда 100% переработанную с ИИ статью:
https://vibeportal.ru/forum/topic/nastupaet-era-targetnoi-terapii-raka
Как и ожидалось — получил близко к 100% Human, т.к. при подготовке работал агент-рерайтер, вычищающий самые очевидные клише.
Напоминаю, что принцип тренировки нейронок по сути — обход детекции. А значит, теоретически детектировать нейротекст может только более старшая модель. Под силам это двум лабам в мире (которым нафиг этим заниматься не сдалось).
Остальные выпускают разнообразные инструменты с предсказательной силой уровня гороскопов.
Вы прикиньте, я таки написал с Kimi K3 инференсилку PaddleOCR-VL в браузере. С нуля!
Поймут не только лишь все, но это как свою операционную систему написать, что ли. Альтернативного инференса нейросетей в мире в принципе очень мало, никто такой херней не заморчивается, это удел крупных лаб.
Ну или недельку с кими 😁
Релиз пока еще только готовлю, нужно это прилично упаковать, провести тесты производительности и все такое. Но сам факт очень прикольный. Цель сделать не только запуск в браузере, но еще и сравнимо с нативом по скорости. Вот тогда буду доволен. Не знаю, получится ли достичь, но попробую. Будет тогда у всех доступное и бесплатное распознавание OCR прямо в браузере, если есть нормальный макбук или видеокарта.
PS Жгутся лимиты на такие развлечения люто, так что если вы хотите меня поддержать донатом — буду очень даже благодарен 😎
erc20 0x0c52dd759F50448680f15a885314aE6DCA7E4cc2
solana 6BgiPmUydCqz8XGFCncTN3k4meT33E5ZCBL6f8erMmf1
tron TKrTz42W3cW5shEi8K912bScMRuPsTMc8s
Kimi значительно лучше делает структуру лэндингов чем опенай. Единственное — пока не смог добиться устойчиво хорошей работы с картинками. Но смысловая часть и верстка гораздо сильнее.
Читать полностью…
Докладываюсь, kimi k3 реально крутая модель. Но жрет лимиты как sol. 100 баксового тарифа на неделю остро не хватило, зарядил 200 😭
Читать полностью…
Очень частый вопрос про датацентр — зачем это нужно в мире, где есть антропик и опенай?
Вопрос более чем валидный. Хочу дать на него ответ.
Антропик и Опенай делают универсальные модели дорого. Для прогеров и R&D эти цены посильны (но и то на грани), а для операционки — туши свет. Бизнесы не вывозят платить такие косты и хотят брать специализированные модели под задачи.
— Но можно же юзать оупенроутер!
Да, можно. Но опенроутер дает голый инференс. То есть ноль сервиса. Бизнесу нужно звонки от клиентов разбирать, а ему дают апи и говорят, что вот это решает его задачу. Но правда в том, что товарищу на том конце провода даже непонятно слово апи 🙂 Это вы все тут умные и в вайбкодингах, 95% народа на земле про это ничего не знает.
Поэтому идем дальше: нужно давать сервисы, а не просто токены. То есть конечному клиенту нужен продукт, решающий его задачу.
— Ну вот, нахера вы делаете датацентр, делайте продукты!
А вот тут мякотка. В продуктах нет moat - то есть, несмотря на то, что клиенту нужен продукт, навайбкодить продукт сейчас быстро. Это мир совершенной конкуренции. А маржа будет делаться на инференсе без которого продукт просто не работает.
— И что же в итоге?
Очень просто. Мы делаем готовые продукты для бизнеса, и даем их дешево или почти бесплатно. А зарабатываем на токенах для того, чтобы эти продукты работали. Со своим инференсом, иначе маржа будет 10% как реселлеру, а не 90% как провайдеру 🙂 И покрываем конкретные специализированные ниши, в которые просто неэффективно лезть с дорогущим железом.
Хетцнер в мире AI инференса.
И вот в чем именно отличие от опенай и от того, чтобы просто набить видеокартами очередной датацентр. Интересно — пишите, собираем раунд, чеки от $50к.
Я сейчас пишу порт PaddleOCR-VL под WebGPU
Это значит, что если все сработает, то на достаточно мощной машине OCR движок можно будет запускать прям в браузере.
И я при этом не использую transformers.js, реализация полностью с нуля. Задача абсолютно отбитая, но мне кажется вполне реалистичная. Расскажу, что получится.
В связи с этим чувствую в воздухе вайбы того, что очень скоро люди будут писать себе под задачи то, о чем раньше даже думать боялись.
Не просто трекер задач, а, например, свои операционные системы (полноценные). Свои аналоги средств виртуализации. Короче, то, что раньше считалось серьезным сложным слоем, в который лучше не лезть. Ощущение, что старшие модельки топовых вендоров уже добрались до того уровня, когда они это смогут делать.
Вообще, как вы видите сейчас, нефть будущего — это вовсе не софт, а железки. Покрайней мере, пока мы не вошли в сингулярность, когда ИИ начнет штамповать их
себе самостоятельно.
Всем бизнесам нужен инференс, но есть проблема: когда компании переводят процессы на LLM, они просто охреневают от счетов за API OpenAI или Claude.
Рынок ломается о стоимость вычислений. Которые можно сильно сократить, если оптимизировать косты на железо и работать со специализированными небольшими моделями, четко подобранными под задачу.
К чему это я?
Мы с @neuraldeep хотим построить свой AI-датацентр в Европе. Мы даем бизнесу тот же результат, но в 90–100 раз дешевле крупных провайдеров.
Продуктово это не просто классический хостинг, а хаб, где мы монетизируем одну железяку трижды: продаем голые токены, сдаем GPU в аренду и продаем бандлы подписок на AI-продукты (чат, RAG, OCR, транскрибация и т.д.).
Самое важное: хаб уже работает в проде и генерит кэш. Без копейки платного маркетинга откручено 21.9 млрд токенов, за 2 месяца, собрано более 1000 платящих юзеров, а операционная маржинальность инференса 90%.
Сейчас мы поднимаем Seed-раунд на $5M (за 25% доли, оценка $20M post-money),
чтобы кратно отмасштабировать флот серверов на весь мир.
Почему мы порвем этот рынок:
1) Идеальная локация. Я живу в хостинговой столице мира — Финляндии. Тут самая дешевая электроэнергия в ЕС и сосредоточены мощности Google, Microsoft, Hetzner, Небиус. В самой Финке нет амазона Амазона (мы платим за доставку из Германии), зато есть его датацентры.
2) Налоги. Местная система может отбирать 60% с зарплаты, но зато максимально благосклонно относится к реинвестированию хоть в трактора хоть в видеокарты. Будем эффективно списывать затраты на железо.
3) Умный CAPEX. Мы не сжигаем капитал на флагманские стойки с B300 под жидкостным охлаждением за бешеные миллионы. Наша ниша позволяет использовать просьюмерские RTX PRO 6000 — это дает нам на 58% больше токенов на каждый вложенный доллар.
4) Валера (@neuraldeep) — абсолютно гениальный технарь с лояльной аудиторией в 15k AI-разработчиков, который готов это отскелить на любой масштаб.
В отличие от венчура, где 90% хипстерских стартапов проедают деньги и закрываются, у нас большая часть раунда пойдет напрямую в закупку GPU.
Это хард-ассет бизнес. Риски даунсайда минимальны: даже если всё пойдет по одному месту, GPU сохраняют свою ликвидность и их можно продать любому другому датацентру, которым сейчас не хватает свободных мощностей. Вы инвестируете в ликвидное железо с окупаемостью 10-15 месяцев, а не в воздух.
Рынок GPU-инфраструктуры сейчас горячий как никогда, и окно возможностей открыто именно сейчас.
Так что если вы инвестор и вам интересно вложиться в понятную AI-инфраструктуру с подтвержденной экономикой — велкам в личку. Пришлю наш питч-дек, финмодель под NDA и отвечу на любые вопросы.
Ну вот, Кими приостановили продажи — не вывозят нагрузки. Только поехал траву потрогать и на тебе. Хотел взять на неделе как сожгу лимиты в гпт 😬
Читать полностью…
бухой админ патчит базу на проде
чет как-то не так я себе представлял максимально-эффективную работу 😁
Помните я говорил, что у меня есть задача которая уже очень долго крутится в goal режиме? Фишка в том что там равномерные сабтаски. Нужно аккуратно сделать и провалидировать в коде около тысячи игровых предметов, каждый из которх описан в тексте вместе со всеми свойствами. Поэтому скорость можно оценить более менее объективно.
Так вот, ГПТ 5.5 extra-high сделала за 2 дня примерно 30% объема работы. 5 дней работы с sol 5.6 max дали всего 15% сверху этого.
То есть она стала как минимум в 5 раз медленнее.
И по ощущениям, это вовсе не глубина думания, а тупо скорость исполнения запросов. Опенай не справляется с нагрузкой и ставит их в очередь, в которой не происходит генерации, а моделька тупо ждет.
Как вариант — думаю временно с этой задачей перейти на 5.5, благо качества ее там хватало. Но переключаться постоянно будет конечно очень неудобно.
А маркетингово, чувствую, нас готовят к выходу быстрого инференса на церебрас, с подпиской баксов за 500, а то и за 1000. Ведь слезть с этой иглы уже нереально 🌚
Если вы видите в твиттере, что у кого-то там модель сошла с ума, что-то удалила и все пропало, то знайте
вам пиздят
Тупо хайпожорство и отсутствие культуры отрубания рук за вранье
У многих на встречах есть умные агенты, но я себя давно ловлю на мысли, что они не очень-то умные, и мне нужен агент поуменее.
В итоге собрал себе скилл который разбирает на фичи и карточки мои комментарии насчет фичей продукта, просто на основе видео которое я с этим записываю.
Скилл создается одним промптом в кодексе. Результат прекрасный. Шуршит, анализирует, собирает полноценнный отчет с доказательствами в виде картинок и отрезков видеодорожки.
Дальше этот отчет можно прямо кинуть в агента чтобы фиксить, ну или читать глазами (как психопат)
Промпт для агента (надиктовано в микрофон без приукрашиваний 🙂):
Твоя задача взять видео и сделать видео, где я объясняю, что не так с интерфейсом сайта и что пофиксить, где шарю экран. Твоя задача сделать из этого некий документ типа HTML с нарезкой фраз, суммаризацией того, что сказано, и скриншотами соответствующих мест того, что я делаю. Соответственно, как бы я поступил? Берем видео, прогоняем через Whisper X, получаем диаризацию плюс тайм-коды, а далее по этим тайм-кодам делаем скриншоты соответствующих мест, ищем, если на скриншоте не совсем, то ищем рядом нужное место, проверяем глазами эти скриншоты и делаем такой некий отчет итоговый в HTML о том, что, собственно, о чем шла речь в видео, сопровождающийся скриншотами по каждому из пунктов.Читать полностью…
Кто там стонет про задачки по 10 часов? 😁 Половина из этого времени была еще на 5.5 с механизмом цели. 5.6 просто научили нативно ставить goal — она теперь сама фигачит до посинения. Так что формулируйте свои желания осторожно, если по-привычке думать, что она быстренько сварганит прототип и успокоиться, можно нехило так влететь в лимиты даже на $200.
Короче, если вы раньше писали что-то типа "обязательно все сделай, ни в коем случае не бросай", то сейчас стоит быть осторожным в своих желаниях 😉
Сейчас, когда нейронки влет пишут любой код, главный принцип кодинга — это налаживание обратных связей. Т.е. вы не столько говорите, как и что сделать, сколько то, как это проверять по шагам. И гварды чтобы не халявило на этом пути. Дальше оно само.
Пример. Делаете фронтенд — думайте о том, как нейронка будет кликать на кнопочки и как примет решение, соответствует ли дизайн тому что нужно (учитывая погрешности ее мозгов в интерпретации картинок).
Делаете алгоритмы — задавайте функцию по которым можно понять, работает алгоритм как вам нужно, или нет.
Сильно отличается от того, как это было пол-года назад — тогда оно плохо за собой проверяло.
Одна проблема — пока так и не заметил у нейросеток чувства прекрасного, поэтому "сделай красиво" все еще не работает.
Да, я обхожу любые детекторы (обращайтесь с коммерческими предложениями 🙂)
Читать полностью…
Общее ощущение — не гениальный, но очень старательный.
У меня есть сложная алго-задача на которой я проверяю агентов, создание специфического 3d движка для игры-аналога Astroneer с нуля. Круглые разрушаемые планеты, воксели, меши поверности, куча проблем производительности, формирования сетки по краям чанков, коллижена и так далее. Короче хорошая взрослая algo-heavy штука.
Сетки ее проходят в очень разном стиле.
Так вот, стиль 5.6 — вгрызться и долбить пока не будет сделано. Крайне старательно сама дебажит, открывает экран, снимает метрики в статике и в движении, и долбит в точку до тех пор, пока не будет работать. Ваншотом не фиксит, просто решает упорством 😁 Такое ощущение что goal засунули в тренинг сет и научили нативно им пользоваться.
А вот гениальности не заметил. Она как раз в ван-шотинге проявляется, а тут если и есть рост, то пока незаметно.