14059
Head of AI redmadrobot.com From IT Admin to Head of AI in 5 years Applied AI Engineer B2C RAG (2M+ books) B2B RAG platform (10+ implementations) B2C gptdaisy.com (100k MAU) github.com/vakovalskii | chat @neuraldeepchat To infinity... and beyond!
Всем привет!
Тут прокатилась волна банов openai акаунтов (моих) API использование
Кого-то тоже затронуло?
Хочу понять что детектировать начали (прокси IP спалил) или уже и запросы стали чекать на RU текст?
Или просто банхамером задело
Хочу понять системность так как отлетает 3 акк
hetzner
Update: всем спасибо за оч полезную инфу
Далее буду осторожнее
Со мной такое в первый раз ( за один акк прям обидно 2 года ему было)
SGR Deep Research топ 3 в open-source!
Пока кипит работа по финализированнию наших тестов и выявлению лучшей архитектуры агента для небольших и недорогих моделей
Хочу с вами поделится очень крутыми новостями!
Бенчмарк и новые фичи!
Что было сделано:
1) Был добавлен MCP как клиент (теперь вы можете подключить любой набор тулов внутрь агента)
2) Проработаны и оптимизированы промпты для читаемости и понимания LLM
<MAIN_TASK_GUIDELINES>
<DATE_GUIDELINES>
<CORE_PRINCIPLES>
<REASONING_GUIDELINES>
Qwen3-VL-8B-Instruct
Мультимодальная LLM на стеройдах для твоей компании?
Запустил вчера на своей 4090(48гб) дабы проверить большой контекст
Сколько стоит и как работает?
4090(48gb) (заняло почти всю память я ограничи на 70к токенов) но vLLM говорит можно 90+
30 t/s (FC/SO)
44 t/s (content)
Дал вам всем доступ попробовать модель через наш кластер
Примеры тут /channel/neuraldeep/1654?comment=20455 (выше есть тесты)/channel/neuraldeep/1656
Много раз спрашивали где я беру такие 4090(48)
Беру тут и с гарантией для меня даже сварганили промокод для скидки KOVALSKII (ребята делают реально крутой сервис вокруг модифицированных карт)
История трёх технологий которые изменили AI (часть 2/3) (1часть)
Учитывая мою инженерную зашоренность, существует четыре домена где совокупность этих технологий работает и дает реальный профит в 2025к
AI Coding
Deep Research
Data Extraction
Search Assistant
Градация от простого к сложному
AI Coding: когда компилятор не врет
GitHub Copilot используют 77 000+ организаций (90% Fortune 100). Рынок $4.91B в 2024, adoption 97%. Cursor собрал 1M+ пользователей за два года. Devin - результаты лучше 74.2% людей ($500/месяц). Windsurf приобретен за $4B+
Почему первый?
Детерминированная валидация компилятор говорит работает или нет
Action space ограничен edit, create, delete, run tests. Microsoft: рост продуктивности на 26.4% через две недели
Acceptance rate 35% - каждая третья подсказка без изменений
Курсор вообще сделал дичь недавно на RL c acceptance табов
Function Calling для LSP, linters, компиляторов чтения файлов редактирование
MCP для Git, CI/CD, документации
Deep Research: когда час искать ответ
Три игрока выпустили решения почти одновременно: Google Gemini (11 дек 2024), OpenAI ChatGPT (2 фев 2025), Perplexity (14 фев 2025) Все работают одинаково: задача → сбор с десятков сайтов → синтез → report за минуты
Perplexity показывает 93.9% на SimpleQA (фактическая корректность)
На Humanity's Last Exam (100+ предметов) - 21.1% vs 6.2% у раннего Gemini
Проблема: нет ground truth для валидации синтеза
Можно проверить что sources существуют, что citations правильные, но правильные ли выводы?
Пока решают через human-in-the-loop
Cost: 50-150 searches + report на 5-30 страниц = $5-15 за request на GPT-5/Claude4.5
Structured Output для citation tracking каждого факта к source.
Function Calling для search APIs, PubMed, ArXiv. MCP для internal knowledge bases, Confluence, SharePoint GDrive
Data Extraction: OCR/VL на стероидах
Современные решения: 95-99% accuracy, 0.5-4 сек на документ based пока не взяли VL
Переход от традиционного OCR к AI-powered. Старый OCR: templates для каждого типа документа, работал на standardized forms, ломался на разных форматах
Новый: LLM-VL, понимают context без templates а если присыпать SO можно извлечь еще больше и контролируемое
Два подхода: OCR engine + VL (Tesseract/EasyOCR → parsing) vs Vision LLM direct (image → data).
Первый дешевле и flexible, второй точнее и быстрее нужно соединять!
Structured Output критичен: output по strict schema для ERP/accounting
Function Calling для OCR APIs, validation. MCP для document management, ERP, accounting software
Search Assistant: RAG для всех
Самый простой технически, самый массовый по adoption
Почему последний по complexity но первый по массовости? Limited reasoning, простая validation (нашел или нет), понятный ROI (saved hour = экономия).
Технически: user query → embedding → vector search → context retrieval → LLM generation → answer с citations
Structured Output для форматирования: ranking, metadata, citations
Function Calling для vector databases (Pinecone, Weaviate), search engines
MCP для simultaneous access: Confluence, Drive, Slack, Jira
Почему такой порядок
Coding → Deep Research → Data Extraction → Search Assistant это текущее состояние и roadmap куда в моей голове бежит весь это снежный ком ИИ
AI Coding лидирует через deterministic validation и я сам оцениваю время которое я за ним стал проводить
Deep Research растет через improved fact-checking
Data Extraction показывает fastest growth благодаря clear ROI
Search Assistant становится commodity feature в каждой SaaS
Это приобретает все больший вайб агентности за счет растущих метрик FC по всем фронтам
Structured Output + Function Calling + MCP это инфраструктура всех четырех доменов
Без SO мы бы парсили невалидный JSON
Без FC агенты не могли бы использовать tools надежно и строить крутых агентов
Без MCP каждая интеграция требовала бы custom code
AIDev конференция: 1000 человек уже зарегистрировались, и вот почему вам тоже стоит
Помните исследование METR, где заявили что Cursor снижает продуктивность разработчиков?
Нюанс простой за инструмент посадили людей, которые открыли его впервые!
Как дать синьору Excel первый раз в жизни и ждать продуктивности 😅
Мои друзья по AI-цеху организовали онлайн-конференцию про настоящий AI Coding, и цифры говорят сами за себя:
- Почти 1000 зарегистрированных (шутка ли!)
- 6 часов контента от практиков
- 14 октября, 14:00 МСК
- Без воды и буллшита только реальный опыт
О чем расскажут?
Программа покрывает весь спектр от новичков до продвинутых:
✅ Правильный старт с AI-инструментами
✅ Архитектура в вайбкодинге
✅ Выбор MCP без хайпа
✅ Работа с контекстом для больших проектов
✅ Feedback loop с AI-агентом
✅ ShotgunPro и другие инструменты
Кто спикеры?
Техлиды, CTO, AI heads и авторы собственных AI-инструментов те, кто пишут production-код каждый день
Почему стоит прийти?
Даже если вы уже кодите с AI — узнаете минимум 2-3 новых подхода, которые сэкономят часы работы.
Если только начинаете получите системный фундамент вместо хаотичных экспериментов
Честно, когда 1000 человек регистрируются за неделю до старта это показатель что тема реально горит! 🔥
Регистрация здесь
Пересылайте друзьям и знакомым, кому зайдет. 14 октября увидимся! 🚀
Как я использовал SGR, не подозревая об этом, и почему советую вам
Сколько бы ты ни работал в какой-либо сфере, уследить за всем просто нереально. В AI буквально каждый день появляются новые инструменты и методы работы с моделями, в частности с LLM. И иногда так бывает, что ты самостоятельно приходишь к чему-то, гордишься этим, а оказывается - про это уже написаны статьи. Так случилось и со мной.
Поле применения LLM довольно широкое, но одной из самых частых задач я бы назвал ускорение производства текстового результата: от оптимизации продуктового ресерча с анализом рыночных и пользовательских данных до частичной автоматизации с помощью AI-ассистентов.
Глобально у нас есть несколько стратегий достижения результата:
- можно просто задать задачу LLM, применяя базовый промптинг или продвинутые техники типа CoT;
- можно использовать RAG, чтобы доставать релевантный контекст из базы знаний;
- можно вдохнуть в LLM агентское поведение, добавив инструменты, и аппрувить промежуточные результаты.
У всех этих методов есть серьезные недостатки. Простой промптинг часто порождает нерепродуцируемость и разброс результатов. RAG и тулы могут упустить важные детали, значимые именно для вашей задачи, потому что модель не всегда полностью понимает, что важно именно вам как специалисту.
Снижение температуры модели помогает, но не решает проблему полностью. Работая с комплексными задачами, когда нужно поэтапно извлечь данные, структурировать и принять решения в рамках одного диалога, я нашёл метод, который позволяет “придушить” модель и получать более релевантный, контролируемый результат.
Как это сделать?
Метод прост - в системных промптах я включаю не только описание задачи, но и детальное описание процесса и критериев результата. Потом даю LLM не просто произвольный текст, а чётко типизированный шаблон вывода, например, в формате JSON Schema, где указываю строгое поле для каждого шага.
Далее этот структурированный вывод я использую как вход в следующий шаг в цепочке. То есть вместо свободного CoT я задаю схему рассуждений - последовательность этапов, типы и формат данных, которые модель должна сгенерировать на каждом этапе. Эта схема заставляет модель придерживаться логики и правил, помогает избежать ошибок и галлюцинаций.
То есть мы получаем метод, в котором вся логика вывода, переходы и схемы валидации жёстко заданы с помощью схем данных. Всё, что вам нужно - это спроектировать качественные схемы и описать логику шагов. Тогда финальные документы и результаты практически не требуют правок.
Это называется SRG
Так я радовался своему “открытию”, пока у Валеры в канале @neuraldeep не наткнулся на аббривеатуру SGR, которая обещала все то же самое 😄 Оказалось, что Schema-Guided Reasoning изобрели еще до меня 😁 Более того, про него еще статейки написали и есть куча холивара на тему того, тру это или не тру 😄 У метода есть сторонники и критики, но на мой взгляд, если нужна предсказуемость, воспроизводимость и контроль над качеством вывода LLM, это лучший подход.
Плюс SGR играет хорошо с RAG и агентскими инструментами: схема помогает управлять, когда и какой контекст доставать, как валидировать промежуточные шаги и принимать решения о следующем действии. Это снижает пропуск важного контекста и улучшает общую надежность.
Если вам надо системно и стабильно получать результат от LLM, рекомендую обратить внимание на SGR. Это не просто продвинутый промптинг - это работа с моделью на уровне структурированных данных и схем рассуждений, что кардинально повышает качество и удобство работы.
После освоения AI-инструментов
Послушал лекцию Александра Крайнова (директор по развитию ИИ в «Яндексе») для студентов Иннополиса — зацепила простая мысль: выбор конкретной LLM уходит в прошлое. Как когда-то мы перестали переживать, каким компилятором собирать код, так и здесь — решать будет сервис.
В нашем business-аккаунте Cursor режим Auto уже стал дефолтом. Команда почти не переключается на конкретные модели — ручной выбор остаётся у энтузиастов (см. скрин).
И это не случайность. OpenAI все понимает и то же движется в эту сторону: летом компания уже пробовала с релизом GPT-5 «спрятать» ручной выбор и оставить автоподбор. Комьюнити отстояло переключатель — но, уверен, это временно.
Что меняется на практике? Смещается точка ответственности. Важно уметь чётко описать задачу (промпт), дать релевантный контекст и проверить качество ответа. Экспертиза — в дизайне запроса и оценке результата, а не в переборе моделей. Похоже, индустрия в целом идёт к меньшему ручному выбору — курс на «задача → результат» без микроменеджмента моделей.
Материалы по теме:
Пост-GPT. Что глобально ждёт индустрию после бума генеративных ИИ — лекция Александра Крайнова
Circuit Tracing от Anthropic: как мы в R&D by red_mad_robot решили заглянуть внутрь LLM при использовании в RAG-пайплайнах
Ищем галлюцинации под микроскопом!
29 мая Anthropic выложили в open-source свои инструменты Circuit Tracing методологию механической интерпретируемости, которую мы в R&D подразделении red_mad_robot первыми применили для решения практической задачи детекции галлюцинаций в RAG-системах!
В начале 2025 года, когда я возглавил новое R&D направление, я поставил амбициозную задачу: не просто оценивать качество ответов LLM "снаружи", а заглянуть внутрь процесса генерации и понять, откуда берутся галлюцинации.
Почему именно RAG-пайплайны и Circuit Tracing?
Проблема была очевидна: RAG-системы часто смешивают информацию из контекста с "внутренними знаниями" модели, создавая правдоподобные, но неточные ответы
Существующие методы детекции работают post-factum, а нам нужно было понять механизм принятия решений в реальном времени
Circuit Tracing от Anthropic давал именно это возможность построить атрибуционные графы и проследить, как токены входного контекста влияют на финальный ответ модели
Конкретные результаты нашего исследования
85% точность детекции галлюцинаций вот что мы получили на тестовом датасете с нашей реализацией на базе Qwen2.5-7B.
Как отмечает наш исследователь Ирина Кошкина:
"Основная идея — измерение доли влияния от токенов входа, соответствующих контексту, среди всего влияния от всех активных токенов."
Наша метрика Groundedness включает:
- Контекстную долю влияния (Gctx)
- Replacement Score — качество признаков vs ошибок
- Completeness Score — полнота объяснения через атрибуционный граф
Технические вызовы и решения
Cross-Layer Transcoders (CLT) стали ключевым компонентом системы
Вместо анализа отдельных слоев мы научились отслеживать влияние признаков между несколькими архитектурными уровнями трансформера
Основные проблемы, которые пришлось решать:
1. Вычислительная сложность процедура анализа на порядки медленнее генерации
2. Зависимость от качества обученного транскодера
3. Токен-уровневое сопоставление, приводящее к ложным срабатываниям
Но результат того стоил мы получили рабочий инструмент для анализа внутренних процессов модели во время генерации ответов в RAG-системах
Отдельное спасибо отделу маркетинга red_mad_robot за подготовку детальной статьи оформления и валидации на Хабре
Отдельное спасибо Саше (@dealerAI) за экспертную валидацию нашей гипотезы на старте проекта
Когда предлагаешь исследовать "атрибуционные графы для детекции галлюцинаций в RAG", поддержка опытных друзей по цеху критически важна для получения ресурсов и мотивации команды
Полный технический разбор с кодом, формулами и результатами экспериментов доступен в нашей статье на Хабре закидываем в закладки и ставим +
Друзья, уже через пару часов мы начинаем, а для тех кто будет онлайн вот ссылки на трансляцию (старт в 19-00 мск):
VK Video
Youtube
До встречи )
P.S.:В комментариях добавили картинки с навигацией как попасть в офис к Лемана Тех
Дружочки!
Уже послезавтра на площадке Леманы Тех пройдет 20я оффлайн встреча сообщества #безвотэтоговотвсего на тему “AI-компас для управленца: куда смотреть, чтобы не пропустить главное”.
Для опоздаваших мы на чуточек приоткрыли давно закрытую регистрацию, есть прям вот пара десятков мест - успевайте )
В панельной дискуссии попробуем разобраться с тем как:
- AI уже в бизнесе, но не везде — как понять, где его место в вашей стратегии
- От хайпа к пользе — как отличить модные игрушки от реальных инструментов
- Какие решения руководители должны принимать сами, а какие пора делегировать алгоритмам
- Главные ориентиры на ближайшие 12–18 месяцев, чтобы быть впереди, а не догонять
- и многое другое)
В честь такого дела с нами шуршать будут уважаемые эксперты:
⁃ Валерий Ковальский — Head of AI red_mad_robot
⁃ Алексей Миловидов — CTO Ecom.tech
⁃ Александр Айваз — CDO, Лемана Тех
⁃ Тимур Вайсман — Директор центра интеллектуализация МТС
Встречаемся на прекрасной площадке Леманы Тех в их офисе (проспект Лихачева 15), 25го сентября в 18:30. Регистрируемся по ссылке 👀
Приходите, будет огненно!)
🔴Продолжаем день релизов - новая открытая моделька!
NotEvilAI/gpt-oss-20b-ru-reasoner - full fine-tuning gpt-oss-20b для поддержки генерации ответов с русским ризонингом с двумя дополнительными режимами reasoning_effort - auto и none.
Спрашиваем на английском - думает на английском, как оригинальная модель. Спрашиваем на русском - думает по-русски. И не надо никаких reasoning language: Russian.
Модель тренировалась в 2 стадии - SFT и DPO на основе нашего синтетического датасета русского ризонинга.
Мы выложили bf16 версию на 20b.
Ставьте 👍, если хотите аналогичную модель на 120b.
Сегодня с утра был очень интересный звонок, отдельное спасибо Ринату что смог уделить время
Обсудили ERC2-ERC3
Затронули карьеру и историю как попал в LLM
Так же обсудили судьбу SGR, и что сообщество сделает свое дело!
А когда-то канал я начал вести читая @llm_under_hood, когда там было 4к подписчиков
📈Рейтинги LLM теряют доверие
Наше исследование (21 июля — 10 августа 2025, практики и предприниматели в сфере ИИ) показало реальную картину: команды всё меньше ориентируются на абстрактные бенчмарки и всё чаще принимают решения через собственные тесты.
👀 Ключевые данные:
— 82,2% проводят собственные проверки и используют бенчмарки только как дополнительный сигнал.
— 26,7% принципиально не опираются на рейтинги.
— Лишь около 18% обращаются к агрегаторам по типу llmstats
Главные критерии выбора AI-решений для продуктов: качество + цена + скорость, устойчивость без галлюцинаций и совместимость с инфраструктурой
📄Отдельная ценность исследования — мы постарались отразить мнение участников рынка таким, какое оно есть: с аргументами «за» и «против», со скепсисом и практическими отзывами. Полный отчёт с графиками, аналитикой и комментариями уже доступен на сайте.
P.S. Огромная благодарность всем, кто помогал собирать данные для исследования, а также авторам и энтузиастам, помогающим его популязировать. Замечания по исследованию и предложения по будущим рисёрч-проектам можно оставить здесь.
Давайте соберем карту внедрений SGR и список частых вопросов по ним
В коммьюнити идут обсуждения про Schema-Guided Reasoning, в основном в контексте Open Source проекта SGR Deep Research. Этот проект для некоторых команд стал первым наглядным примером того, как подойти к задаче построения умного агента на базе относительно небольших моделей (в том числе и локальных). Чаще всего слышим про попытки адаптировать методы в банковской сфере и промышленности. Может быть нас еще больше?
Давайте вообще систематизируем весь этот процесс и сделаем его эффективнее для коммьюнити!
Вот анонимный опросник, чтобы построить более полную карту внедрений по отраслям и собрать вопросы. Опросник: Строим вместе карту внедрений SGR
Результаты опроса и ответы на самые частые вопросы будут в каналах:
- LLM под капотом
- Neural Kovalski
Ваш, @llm_under_hood 🤗
SearXNG Tavily Adapter: когда жаба душит платить за поиск 🐸
Надоело тратить деньги на Tavily при тестировании агентов?
Мне тоже! За вечер сделал решение
Проблема: Tavily API съедает бюджет при разработке research агентов
Уже на тестах улетело больше $100 а это мы еще к бенчмаркам не перешли
Решение: SearXNG (open-source метапоисковик) + мой адаптер = drop-in замена Tavily достаточно поднять и сменить base_url уже звучу как маркетолог (нет)
# Было (платно):
client = TavilyClient("tvly-дорогой-ключ")
# Стало (бесплатно):
client = TavilyClient(api_base_url="http://localhost:8000")
git clone https://github.com/vakovalskii/searxng-docker-tavily-adapter
docker compose up -d
# Готово! API работает на localhost:8000
SGR Code Agent
Мысль от @elkornacio которая вдохновляет
Мне кажется втайне каждый разраб мечтает запилить кодового агента это же как сына растить - ты делаешь что-то, куда закладываешь логику собственного поведения, пытаешься формализовать то, как ты сам пишешь код, в набор правил
История трёх технологий которые изменили AI (часть 3/3)
[Часть 1] | [Часть 2]
От технологий к людям
Технологии решены:
- XGrammar дал 100% reliability
- MCP упростил интеграции до registry
- Function Calling стал стандартом
Проблема в трансформации компаний и людей
Что я вижу внедряя AI в компаниях
Компания№1: "Сделайте как ChatGPT для наших данных"
Реальность: 80% времени объясняю что агент нужно учить, он не знает все сам
Компания№2: Compliance требует "всегда правильные ответы"
Реальность: учим принимать вероятностную природу AI, строить checkpoints
Компания№3: Разработчики боятся замены
Реальность: превращаем code writers в AI directors роль усложняется, не исчезает
Джуны нужны?
Наблюдения которые не ложатся в метрики:
→ Переход на AI = смена типа людей с исполнителя на менеджера
Не все переживут (вчера ребята на конфе это проговорили)
Цикл "постановка → ожидание → проверка" невыносим для некоторых
→ Tacit knowledge в организациях
Люди не могут четко выразить что знают
Им кажется очевидным, но вытащить крайне сложно
→ Неравенство усилилось
Роль конкретной личности резко возросла (сужу по себе)
→ Сеньоры открытые к AI — искал медь, нашел золото!
Внедрение сверху ("купим подписки и курсы") не работает
→ Разработка сместилась к спекам и верификации
Код генерит AI. Отбирает кайф у тех кто любит писать нужен цикл смены
→ Личная трансформация: куда девать время?
Задачи решаются в 3-5x быстрее. Свободное время появилось, но что с ним делать?
Одни идут глубже в архитектуру, другие теряются
Внедрение AI = структурные изменения = рефакторинг организаций
Технически-культурно-психологические вызовы
Надо думать над всем спектром сразу
---
"Вайб Цех"
Я совместно с red_mad_robot решил организовать "Вайб Цех" в Питере обсудить с вами то как меняется роль человека в разработке
Хотелось собрать небольшое кол-во ребят в оффлайне кто связан с AI
Показать слайды которые накопились
И поделится с вами своими мыслями
Давайте разлогинемся на один день!
Буду весь день на площадке
Обсудим трансформацию 25 октября
Не про фреймворки
Про людей
Программа:
- 10:00 — Я: от писателя кода к AI-дирижеру
- 10:20 — Саша Абрамов (SberAI): почему LLM так хороши в программировании
- 11:00 — Макс Скорченко: как перестать работать и начать управлять
- 12:00 — Секретный production case
- 12:40 — Панель: место человека в системе с AI (модерирую) СберТех, Cloud.ru и SberAI
Обсудим практически:
- Куда девать время когда продуктивность выросла в 3-5x
- Как вытащить tacit knowledge из команды для агентов
- Кто справляется с переходом исполнитель→менеджер, а кто нет
- Реальные кейсы внедрения без теории
📍 Not Bad Loft, Курляндская 48, СПб
📅 25 октября, 10:00-15:00
🎟 https://red-mad-robot.timepad.ru/event/3605115/
Offline (платно, личное общение + кейтеринг и классный лофт)
Online free link
После 15:00 — нетворкинг, разбираем ваши кейсы
P.S. Пишите в комментах: какие проблемы трансформации видите в командах?
Соберу для панельной дискуссии
Больше не будет OCR?
Расчехлить 4090
Достаем бенчи и картинки!!!
Делаю тест!
Link https://huggingface.co/collections/Qwen/qwen3-vl-68d2a7c1b8a8afce4ebd2dbe
update: развернул на своем сервере
Qwen3-VL-8B-Instruct
История трёх технологий которые изменили AI (часть 1/3)
После марафона на 30 дней по sgr-deep-research (спасибо вам за 500+ звезд) сел разбираться за историю и матчасть Structured Output, Function Calling и MCP, оказалось это история полная косяков провайдеров и года потраченного на исправление того что должно было работать с первого релиза
И так составил вот такой вот таймлайн дабы закрепить изученный материал и передаю его вам =)
Июнь 2023: Function Calling появился первым и сломанным
OpenAI 13 июня выкатили Function Calling для GPT-4 и GPT-3.5-turbo, идея была крутая, LLM может вызывать функции с аргументами через JSON Schema контракт, разработчики обрадовались но радость длилась недолго
Проблема была жосткая, аргументы функций приходили невалидными!
LLM могла выдать temperature как строку "twenty degrees" вместо числа 20, могла забыть кавычки у ключей, могла написать "celsuis" вместо "celsius"
Все лепили костыли в виде retries и validation вручную (я тут менял работу из DevOps в CEO)
OpenAI не сказали об этой проблеме явно, просто в документации было "рекомендуется валидировать аргументы", на деле reliability меньше 60%, в production такое не работает
Июль 2023: Structured Output как отдельное решение
Параллельно появилась библиотека Outlines, она решала другую задачу, как заставить LLM генерировать строго валидных структур
Механика простая, генерировать маски для токенов через logit-bias, блокировать невалидные токены на уровне бэкенда внутри модели
Вышла научная работа "Efficient Guided Generation for Large Language Models", там описали как через Context-Free Grammar (CFG) контролировать генерацию на уровне токенов
Параллельно развивался guidance от Microsoft Research, их guidance реализовала constrained decoding
Она работает очень быстро: ~50 микросекунд на токен через CFG parser с алгоритмом Earley
Вся соль в том что Structured Output, Function Calling и guidance развивались ОТДЕЛЬНО почти год КАРЛ!
Как будто изобрели руль и колёса по отдельности а потом удивлялись почему машина не едет
Ноябрь 2023: JSON Mode не решил проблему
OpenAI добавили JSON Mode, он гарантировал валидный JSON синтаксически, но НЕ гарантировал соответствие schema!
Могли прилететь другие поля, неправильные типы данных
В тот же месяц Anthropic выкатили Claude 2.1с beta версией Tool Use на 200K контекстном окне, у них была та же проблема, аргументы могли быть невалидными
Индустрия билась над одной проблемой, как заставить LLM генерировать валидные аргументы для функций, каждый провайдер решал по своему, единого стандарта не было
Май 2024: Anthropic первыми сделали Tool Use стабильным
30 мая Anthropic объявили что Tool Use стал generally available для всего семейства Claude 3, reliability значительно вырос Проблема с невалидными аргументами почти исчезла, я предполагаю что они видимо встроили аналог Structured Output внутрь Tool Use первыми
Август 2024: 100% reliability достигнут
6 августа OpenAI выпустили gpt-4o-2024-08-06 которая достигла 100% reliability через комбинацию constrained decoding и fine-tuning, до этого gpt-4-0613 показывал меньше 40%
Важный момент: в официальном acknowledgments OpenAI признали что Structured Outputs вдохновлён работами open-source, включая outlines, jsonformer, instructor, guidance и lark
Ушёл ровно год чтобы довести до production-ready, целый год разработчики мучились с невалидными аргументами и писали костыли
Near-zero overhead в JSON generation означало что Structured Output почти не замедляет inference, это сделало технологию production-ready для высоконагруженных систем, интегрировали в MLC-LLM, SGLang, а в январе 2025 в vLLM и TensorRT-LLM на офф уровне
Ноябрь 2024: MCP как решение проблемы N×M интеграций
25 ноября Anthropic анонсировали Model Context Protocol, ответ на проблему что каждый AI агент требовал кастомную интеграцию с каждым data source
Апрель 2025: Google и OpenAI поддержали MCP
Google DeepMind с CEO Demis Hassabis публично подтвердили поддержку MCP, OpenAI тоже анонсировали поддержку протокола, это означало что MCP может стать стандартом де-факто
RAG, ты в ответе за то что знаешь?
В начале этого года мы с вами собирали naive RAG на стриме
Accuracy был 45-70%, галлюцинации на 30%, все радовались
Но честно? Это не работало в production пришлось изобретать DCD и кучу обвязки сверху что бы заставить работать хоть что-то на 7b модельках
Графы, онтологии, фреймворки перепробовал всё
15 лет данных компании, 3 топика (HR/IT/Sales),
и ни одно решение не взлетело как надо
С начала лета я погрузился в агентную движуху по уши
И кажется, я знаю как сделать по-другому
Но проверить хочу вместе с вами
Structured Output (SO) — это не хайп, это must-have
Без него LLM генерит кашу вместо структуры
vLLM/Sglang + локальные модели пока чуть ли не единственный
контролировать costs и latency в контуре
Прозрачность > черные ящики
Граф и workflow лучше чем "магия фреймворков"
Small Model Language могут дать +20-30%
там где я вообще не ожидал (реально!)
GraphRAG и онтологии красиво звучат
но на практике больше боли чем пользы
Готовые фреймворки (LangChain и тд)
я слишком ленивый что бы проходит EVE c 0
Вайб Цех: как LLM меняют практику разработки
Один день — один цех, где производство кода становится совместной работой человека и модели. 25 октября проведём митап для инженеров и исследователей, работающих с LLM и GenAI, и разберёмся, как вайб-кодинг меняет саму структуру разработки.
↗️ Валерий Ковальский (red_mad_robot) откроет программу и расскажет, как разработчик переходит от написания кода к работе с целями и промптами.
↗️ Александр Абрамов (SberAI) продолжит темой эффективности LLM — от архитектуры до обучения с подкреплением.
↗️ А Максим Скорченко (red_mad_robot) покажет, как превратить модели в инструмент управления и сместить фокус с исполнения на результат.
В завершении — панельная дискуссия с участием спикеров из SberAI, Cloud.ru и СберТех.
Изучить всю программу и зарегистрироваться можно тут.
#AI_moment #роботайм
↗️ red_mad_robot
Про AI-комьюнити: где ваш код, "эксперты"?
О наболевшем!)
Что мы реально выпустили за полгода
Без Артема ничего бы не получилось /channel/virrius_tech ты крут!
SGR Deep Research 494 звезд и 87 форков, MIT лицензия
WhisperX с фронтендом 16,437 строк кода, 30 звезд и 8 форков
speechcoreai.com
Продуктовое решение на базе прототипа 800 пользователей сделали 12к транскрибов бесплатно
SearXNG Tavily Adapter бесплатная замена Tavily, 90 звезд и 10 форков
RAG-бот 2к человек задали вопросы, 8к ответов выдано
Итого: ~614, 105форков, 800 активных пользователей, 12к транскрибов, 2к пользователей бота это я еще не беру 2-3 бота в которых я перестал считать метрики изредка слежу
Что бесит лично меня?
Выпускаю SGR
Диванный критик такой:"Манипуляция результатами" "XML методика лучше"
Публикую Circuit Tracing "Думал об этом год назад" "Хайпитесь на Anthropic"
Выпускаем WhisperX фронтенд "Тривиально" "За вечер сделаю"
Факты жестче слов: 87 форков SGR, 85% accuracy у Circuit Tracing (первые в мире!), 800 человек реально пользуются транскрибатором каждый
Мир аббревиатур vs реальный код
Хейтеры оперируют: RAG LLM SGR MCP CoT RLHF, SHMEX
"Я знаю все аббревиатуры значит я эксперт"
Делают презентации со схемами, скрины из IDE с блюром, ведут в личку за платной консультацией
Говорят: "Anthropic туфта OpenAI туфта всё туфта"
Результат: 0⭐️ на GitHub, 0 строк кода, 0 реальных пользователей
Те кто реально пушат vs те кто критикует
Честно говоря, заметил и такой паттерн все хейтеры которые реально что-то делают, пришли и начали пилить SGR вместе с нами!
А те кто сидит в закрытых тусовках (ой их забанили везде) переходят на личности, копипастят ответы из LLM, не могут спорить по существу
У них нет кода есть только апостол в виде LLM с которым они советуются =)
Выбор который делаю каждый раз я
Вариант А: Потратить 2-3 часа на споры в комментах, пойти на поводу, отвечать, думать, крутить результат ноль потраченные нервы
Вариант Б: Те же 2-3 часа потратить на код получить +1⭐️ и +10 пользователей
Всегда выбираю Б
Я лично все больше чувствую что хейт реален борьба с json стетхами реальна
Но код реальнее всего!
Он реальнее любой простыни в корнетах или поста хейта
Вот зачем я занимаюсь open-source!
Мой критерий простой
Цитаты великих из двора
Говорить легко делать сложно
Нужны ли стандарты оценки качества LLM-приложений и моделей?!
Сегодня появляется все больше продуктов, внутри которых используются agentic-сценарии, а RAG есть уже почти у всех. И чем сложнее становится пайплайн, тем сложнее (простите за тавтологию) и важнее контролировать его.
Когда у вас простой пайплайн, можно настроить оценку его качества и безопасности, выполнив список довольно понятных шагов:
🟣определить критерии оценки и выбрать метрики
🟣покрыть пайплайн интеграционными (а где-то юнит) тестами
🟣собрать небольшой бенч и гонять его (если тестов недостаточно)
🟣и даже настроить проверку детерминированности пайплайна
Если же вам надо оценивать пайплайн, состоящий из множества разных компонент, придется строить что-то типа Сокола Тысячетелия из Lego🦧
И тут хочется поделиться статьей Apollo Research We Need A ‘Science of Evals’, которая содержит интересные размешления об оценке качества и безопасности (и хоть она 2024 года, все еще не потеряла своей актуальности). Ее идеи можно отразить в следующих тезисах:
🟣сейчас оценка качества больше похожа на искусство, чем на науку. Потому что результаты оценки качества сильно зависят от множества мелких деталей (например, форматирования промптов), порой вызывая колебания точности до 76 пп. Это приводит к тому, что используемые продукты становятся менее безопасными
🟣разделяют 3 этапа зрелости Eval-ов. Начальный (Nascent) — исследовательский, где отсутствуют стандарты. Промежуточный (Maturation) — появляются соглашения по лучшим практикам, но пока нет единой регуляции. Зрелый (Mature) — действуют формальные стандарты, статистическая обоснованность, результаты интерпретируемы. Мы сейчас в Т-Банке постепенно закрепляемся на этапе 2 (Maturation) и это совсем непросто
🟣и чтобы сделать свои Eval-ы Mature, вот что потребуется: описать множество четких и интерпретируемых метрик, покрыть тестами как можно больше частей пайплайна, обеспечить надежность и воспроизводимость и не забыть про статистическую значимость
Выглядит не очень тривиально, да? Потому что и так есть вопросы к бенчмаркам и оцениваемым моделям, а тут надо оценивать массивный пайплайн.
И вот буквально неделю назад вышел новый стандарт оценки качества моделей STREAM (A Standard for Transparently
Reporting Evaluations in AI Model Reports). Он предлагает формат для стандартизации тестирований моделей и представления результатов. И хоть в большей степени ориентирован на ChemBio бенчмарки, авторы пишут, что его получится использовать и для бенчмарков из других отраслей.
Скоро расскажу вам о нем подробнее, а пока дочитываю статью
Экономная экономика on-premise LLM
Итак, когда я начинал работать с локальным инференсом и закрытым контуром, я как и вы искал API, которые мне покажут, как оно работает и что могут такие модели
Но я очень быстро понял, что я не могу проверить что же происходит на бэкенде у API провайдера и есть только карточка модели, в которой информация не всегда совпадает с реальностью
Такой подход для оценки потребности в клиентских решениях мне не подходил
Что я для себя понял за 2 года закупая разного рода оборудование
Да, есть Китай MTT, но очень не стабильна поддержка определённых версий фреймворков
Да, есть NVIDIA A100/H100, дорого богато
Есть игровой сегмент, надежно ли?
Учитывая мой опыт работы с железом на предыдущих местах работы, я принял решение попробовать закупить модификацию 4090(48), для предоставления новых топовых моделей от open-source, в целях повышения продуктивности сотрудников и прикладных тестов
Что я получил за 2.5 млн рублей?
qwen3-32b
qwen2.5-32b-VL-Instruct
qwen2.5-32b-coder
Важно отметить, что платформы(сами сервера) уже были приобретены ранее и сейчас идет замена RTX A4000 на 4090(48)
Данный набор моделей позволил обеспечить часть сотрудников и RND отдел постоянно доступными мощностями для экспериментов и базовых запросов
Сейчас прошел год с момента покупки первой такой карты и за это время в ней были заменены термаха и убрана пыль
Брать ли мой опыт на вооружение решать вам, я лишь транслирую наблюдения и примерную стоимость такого решения
Про скорость генерации на такой карточке можно найти по каналу
4090(48)Читать полностью…
Все утро играл в миниапп который сделал Леха, пилим лидерборд и выкатываем в маркетплейс?
А как вы боритесь за продуктивность?
Вместе с коллегами по цеху взялись за интересный бенчмарк по deep research - SealQA.
Хотим протестировать разные подходы к реализации ReAct-агентов, но с одним важным условием: использовать только небольшие LLM, в идеале до 30B параметров. Сейчас для тестов взяли gpt-4o-mini.
🤔 Почему это важно?
Большие LLM, без сомнения, справляются лучше, но они всё ещё дороги. И хотя со временем все модели дешевеют, вопрос выбора оптимальной LLM под конкретную задачу никуда не денется. Такие исследования как раз и помогают понять реальные возможности небольших моделей.
SGR Deep Research бенчмарк?
В предыдущем посте я рассказал, как мы выкатили наконец стабильную версию sgr deep research системы, что бы начать прогонять разных SGR/non SGR агентов по бенчам и задачам
Времени конечно у команды open-source на это не очень много, но то, что я успеваю руками делать, то делается через "Курсор" 😈
Что я себе навайбокдил
1) Логи, очень и очень подробные логи
2) Интерфейс, что бы эти логи не читать в терминале или в IDE
3) Разные виды промптов (для gpt-4o-mini/qwen)
Нашел топ SealQA бенчмарк как я считаю, для Deep Research.
Почему? Я дал вопросы от туда паре человек, так они искали ответ 30 минут (считаю что бенч, отличный)
Далее нашел топ агента ROMA, который выбивает SOTA под этот бенчмарк, и о ужас, что я увидел в промптах, примерно 15к токенов разных оверфитов и трюков для прохождения бенча, бям
Я же решил таким не заниматся и прогнал на 111 вопросов, и глазками просмотрел(больно) что имеем gpt-4o-mini выбила 0.25 точности (не густо?)
Зайдите в бенч сами, увидите, сколько модели выбивают на нем, а выбивают они 0
SealQA is a new challenge benchmark for evaluating SEarch- Augmented Language models on fact-seeking questions where web search yields conflicting, noisy, or unhelpful results
За сим я откланяюсь дальше творить добро и знания в мире LLM, где все покрыто тайной и мистификацией
Кстати поглядеть кусочек логов и трейса можно тут
Репо: https://github.com/vakovalskii/sgr-deep-research
В каких компаниях вопросы про SGR стоят острее всего?
Это предварительные данные опроса ранее.
Выборка пока не очень большая, но уже предварительно видно, что больше всего вопросов возникает у компаний размером 11-50 человек, которые работают в Business Services и хотят попробовать внедрить методы/агентов на базе SGR в продажи или маркетинг.
Medical, финтех и производство идут следующими.
Цвет на графиках тем интенсивнее, чем больше вопросов про SGR возникает, мы это будем использовать при приоритизации ответов.
Опрос еще идет, можете оставить свои вопросы вот тут (или переслать коллегам для заполнения): Русский / English.
Ваш, @llm_under_hood 🤗
SGR Deep Research v0.2.0
Один из самых крутых подарков на мой др сегодня, еще вчера был др у моей Жены, так совпало что у нас разница в один день мы две дико разные Девы =)
Она, кстати, главный спонсор запятых в моих постах
Спасибо всей команде sgr что принимает участие в разработке core ядра для последующего тестирования.
Архитектура и основная реализация в коде - Артём
Ревью, код и идеи с организацией проекта - Павел
Ревью, инфраструктура и идеи с организацией проекта - Михаил
- Определили базовые сущности агента, его тулов
Выделили три основных этапа: reasoning, select_action, action
- Собрали 5 агентов, разных по принципу работы, добавили их в api
- Структурировали логирование работы агента
- Внедрили и затестили вебсёрч на базе бесплатного движка
- Пересмотрели организацию библиотеки, провели множество улучшений в коде
Как сказал наш NLP Lead
«SGR это как ReAct агент с вайбом декларативного агента»
Нас ждут тесты тем временем sgr-deep-research набрал 400+ звезд я уже получаю фидбек что данный подход начинают применять в крупных РФ компаниях
Напомню что наше дело лишь демонстрация еще одного инженерного подхода, на прорыв и истину мы не претендуем
Если вы хотите поблагодарить команду SGR, ускорить разворачивание постоянного доступа к агентам я решил сделать ссылочку для донатов на сервер с 5090 который расположу в своей северной
Репо: https://github.com/vakovalskii/sgr-deep-research
У нас тут осень крепчает, будьте осторожны.
#meme