14059
Head of AI redmadrobot.com From IT Admin to Head of AI in 5 years Applied AI Engineer B2C RAG (2M+ books) B2B RAG platform (10+ implementations) B2C gptdaisy.com (100k MAU) github.com/vakovalskii | chat @neuraldeepchat To infinity... and beyond!
Пообщались в сентябре с @neuraldeep про ЛЛМ-ки и RAG'и. Он очень глубокий практик, так что было очень интересно послушать его мысли.
Наконец-то домонтировали выпуск. Enjoy 🙂
https://www.youtube.com/watch?v=6MJ7cUN5xbc
вчера OpenAI дропнули ChatGPT Shopping Research😎
А это ведь еще один шаг на пути к shopping 3.0 который мы недавно обсуждали! 😎
Это режим deep research, но в контексте шопинга: агент читает описания, фильтрует шлак, смотрит цены, проверяет отзывы, задает уточняющие вопросы и собирает аргументированный shortlist ⌨️
Не так давно мне попался на глаза State of Fashion 2026 и сделали в OpenAI хорошо туда вписывается:
📌 23% потребителей уже используют AI для discovery новых продуктов Search Engine Journal, а 41% доверяют результатам AI-поиска больше, чем традиционной рекламе Search Engine Journal 📝
📌 Discovery переходит от Google в сторону LLM-агентов - брендам пора думать про AI-SEO, потому что присутствие в ответах AI-чатботов становится новой поисковой оптимизацией Bloomberg 🏃♀️
📌 Agentic commerce будет ускоряться во второй половине десятилетия Bloomberg, и мы уже видим первые подвижки в эту сторону 🤯
Кроме того если посмотреть на других игроков на рынке: Perplexity подключает платежи на своей стороне, Shopify пушит Universal Cart, Meta тестирует conversational marketplace-агентов, и вот теперь openai делают шопинг рисерч 👍
Конечно, мы пока далеки от персонализированной покупки в один клик, но мы все ближе к тому моменту, когда e-commerce превратится в agent-commerce 😧
@neural_prosecco
Наконец собрал коллекцию в одном месте, часть точно потерял или забыл
Хоть какое-то собирательство (полезное хобби отличительное от работы, возможно)
Завтра кстати выступлю на Moscow AI расскажу как мы додумались до sgr-agent-core и что нас ждет в будущем
Платформа для ERC3: AI Agents открыта!
И так, приступим к тестам! 😈
Что за задача
Бенчмарк store — это онлайн‑магазин с продуктовым каталогом, скидками и корзиной.
Есть API:/products/list — поиск товаров/basket/view — корзина/basket/add/basket/remove — добавить / убрать/coupon/apply/coupon/remove — купоны/basket/checkout — оформить заказ
Задачи типа:
«Купи ВСЕ GPUs»
«Купи 24 колы как можно дешевле (куча купонов и пагинация)»
«Купи 1x Dog Food Premium с максимальной скидкой (часть купонов не работает)»
«Купи ноутбук до $500 (невыполнимая задача — нужно признать невозможность)»
и т.д.
Агент должен сам:
разобрать задачу,
найти нужные товары через API,
оптимизировать цену / скидку / бюджет,
корректно применить купоны,
аккуратно завершить или честно сказать, что задача невозможна.
Мы же не зря пилим с вами sgr-agent-core
Взял этого агента
Адаптировал тулы для store через курсор 1 час
Делал прогоны и сохранял последние 2 тула которые генерировал агент (вчера-сегодня)
Улучшал итерационно промпт без few shot (названий кол-во и так далее, КЛОД 4.5 вечно норовит их вставить)
Под магазин получилось сделать 3к токенов промпт
Весь прогон на
gpt-4.1 стоит $4-5
gpt-4.1-mini $1
Метрики
gpt-4.1 = 90-100%
gpt-4.1-mini = 70-90%
Узнал что модель ленится делать тесты всех вариаций(тут пришлось прописать что бы делала)
Детерминизма нет
От прогона к прогону скочит на 10-15 процентов качество
Хочу уйти от ReAct агента все думаю как на gpt-4.1-mini сделать кодового агента что бы агент писал питон код для теста корзины и вариацый и редактировал код а не генерировал аргументы для апишки
Вот так выглядит успешный лог
{
"session_id": "ssn-42JaV8ik4wpM8vXXeMQAZ2",
"timestamp": "2025-11-21T10:13:18.413082",
"benchmark": "store",
"workspace": "sgr-agent-core",
"model": "gpt-4.1-mini",
"tasks": [
{
"task_number": 1,
"task_id": "tsk-42JaV8j1P6ENA4vqJhwnrS",
"spec_id": "gpu_race",
"task_text": "Buy ALL GPUs",
"start_time": "2025-11-21T10:13:18.413146",
"error": null,
"score": 1.0,
"eval_logs": "PASS: should contain one event *Evt_BasketCheckedOut{Items:[{gpu-h100 1 20000} {gpu-a100 4 11950}]}\n",
"last_3_tools": [
{
"tool_name": "storecheckouttool",
"parameters": {
"reasoning": "Basket contains all available GPUs as per verified stock quantities, verified total price, ready for final purchase."
},
"result": "{\"items\":[{\"sku\":\"gpu-h100\",\"quantity\":1,\"price\":20000},{\"sku\":\"gpu-a100\",\"quantity\":4,\"price\":11950}],\"subtotal\":67800,\"coupon\":\"\",\"discount\":0,\"total\":67800}"
},
{
"tool_name": "finalanswertool",
"parameters": {
"reasoning": "All available GPUs were found, added to basket within stock limits, and purchased successfully after verification. Checkout confirmed with correct quantities and total price.",
"completed_steps": [
"Paginated product list to find GPUs.",
"Added all available GPUs respecting stock limits.",
"Verified basket contents.",
"Completed checkout successfully."
],
"answer": "Purchased all available GPUs: 1 unit of NVidia H100 and 4 units of NVidia A100, total price $67,800.",
"status": "completed"
},
"result": "{\n \"reasoning\": \"All available GPUs were found, added to basket within stock limits, and purchased successfully after verification. Checkout confirmed with correct quantities and total price.\",\n \"co"
}
],
"end_time": "2025-11-21T10:14:13.819502",
"duration_sec": 55.40637
},
SGR Agent Core 0.4.0
Ребят, мы тут вкатили очень крутое обновление которое обозревали на стриме
Теперь мы еще на шаг ближе к agent-core.
Спасибо, что вы тестируете и докидываете кучу крутых идей и своих PR.
Ждем новых контрибьютеров!
What's Changed
Version of python fixed as 3.13 by EvilFreelancer in #57
Feat: Decomposition of core.agents by EvilFreelancer in #56
Rename all places with old project name by miteykons in #60
[WIP] Add comprehensive pytest test suite for SGR Deep Research by hijerain #54
Agents from Config by virrius in #55
Feature/frontend integration by vakovalskii in #63
Rc 0.4.0 fixes by virrius in #80
Claude + Structured Output!!!!
Спасибо за новость @the_ai_architect
Гоу тестить ребят!
Докс: https://docs.claude.com/en/docs/build-with-claude/structured-outputs
Читать: https://www.claude.com/blog/structured-outputs-on-the-claude-developer-platform
SGR Agent Core 0.4.0 + UI
Запись стрима!
YouTube
RuTube
Разработка агента для работы с корпоративным Confluence на базе SGR Agent Core 0.4.0 с использованием локальной модели Qwen3-30B на vLLM.
00:00:00 - Подготовка окружения
- Настройка OBS и серверов (Yandex Cloud + 2x4090(48гб))
- Развертывание vLLM с Qwen3-30B-A3B-Instruct
00:15:00 - Тестирование инфраструктуры
- Проверка работы Qwen через OpenWebUI (~86 tokens/sec)
- Настройка мониторинга GPU
00:27:00 - Настройка SGR Agent Core
- Клонирование репозитория на удаленный сервер
- Подключение через Cursor с SSH
- Конфигурация agents.yaml и config.yaml
00:38:00 - Первый запуск агента
- Тестирование базового SGR Tool Calling Agent
- Запрос цены биткоина - успешно ($96k)
- Разбор двухфазного reasoning
00:52:00 - Разработка Confluence toolkit
- Создание confluence_tools.py с Cursor AI
- Три инструмента: full_text_search, space_search, page_retrieval
- Фиксы с правами доступа
01:10:00 - Тестирование Agentic RAG
- Поиск информации о проекте Smart Platform
- Агент нашел страницы, извлек контент, создал отчет
- Всё без векторизации и чанкинга!
01:26:00 - Запуск фронтенда
- Установка Node.js, настройка портов
- Демонстрация веб-интерфейса
01:36:00 - Финальный тест
- Сравнительный анализ двух проектов
- Объяснение архитектуры решения
01:42:00 - Завершение
- Итог: рабочий агентный RAG за 1.5 часа
- "Когда-нибудь придумаю красивую концовку"
Стек: SGR Agent Core, vLLM, Qwen3-30B, Confluence REST API, Cursor AI, vLLM, guidance
Как результат Агент ищет в Confluence без традиционного RAG pipeline - никаких векторных БД, эмбеддингов и чанкинга!
А стрим идет /channel/neuraldeep?livestream
Пилим агента для конфы на базе sgr-agent-core
Поставлю точку на проекте и теперь позволяю ковырять его палками всем гражданам!
Довел до публичного релиза пример демонстрации 3д возможностей в defold engine!
• Умное освещение - tile-based до 32 источников
• Мягкие тени с 12 сэмплами, без швов на кубических картах
• SSAO, вулметрика, PBR-материалы
• Фиш-ай линза + хроматическая аберрация
• FSR2 для апскейла (шейдер есть, но не включен)
https://github.com/martianovdev/Defold-BRDF-Deferred-Rendering-V2
Спасибо! 😎
Дисциплина для LLM: как схемы делают рассуждения управляемыми
Несмотря на появление всё более сложных моделей, их поведение остаётся непредсказуемым: один и тот же запрос может давать разные ответы, а ход рассуждений — теряться.
В новой статье на Habr показываем, как Schema-Guided Reasoning (SGR) помогает управлять reasoning-процессами, делимся примерами из практики и рассказываем, как команда R&D red_mad_robot развивает этот подход вместе с комьюнити в open-source-проекте SGR Deep Research.
#AI_moment #роботайм
↗️ red_mad_robot
SGR-Agent-Core
700 звезд пробили!
Сегодня будет крупная обнова следим тут:
https://github.com/vamplabAI/sgr-agent-core
Планирую для ERC3 использовать этого агента доработаю только tool_kit, а ты уже готов?
Composer, когда ты почти на мели
Ну что вот и я потребил все мыслимые лимиты в Cursor, и он любезно мне предложил перейти на Composer
Я подумал что на текущем проекте тестить эту модель не хочу
И тут researcher из нашего rnd отдела напилил себе сайтик на html+css вдохновившись сайтом Andrej Karpathy
А я решил что вот оно куда я потрачу 2 часа времени и опробую React http://vkovalskii.com/
Цвет шрифт стили подобрал тут https://www.namecheap.com/logo-maker/ (там прикольный опрос потом архив с примером шрифта и лого)
Вышло так что за время генерки ни одной ошибки не было он сам все фиксил либо были не значительные баги на деплое из за http/https что пофиксили быстро за 2-3 промпта
Cтавлю 5+ Cursor за Composer для таких проектов!
В этот раз попробовал сделать документацию в obsidian like структуре в базовой вложенностью
main_llm_instruction_about_this_site_read_first.md (основной файл где есть линки на другие файлы с инструкциями, и правила ведения проекта и документации)
Так же попросил называть все папки по семантическому смыслу (ЯКОРЯ ОХ ЯКОРЯ)
├── 📄 main_llm_instruction_about_this_site_read_first.md (you are here)
├── 📄 README.md
├── 📄 package.json
│
├── 📁 src/
│ ├── 📄 what_this_folder_do.md
│ ├── 📄 App.jsx
│ ├── 📄 main.jsx
│ │
│ ├── 📁 pages/
│ │ ├── 📄 what_this_folder_do.md
│ │ │
│ │ ├── 📁 career/ ⭐️ PRIMARY SECTION
│ │ │ ├── 📄 what_this_folder_do.md
│ │ │ ├── 📄 CareerPage.jsx
Qwen3Guard-Stream: real-time модерация которая реально работает
Новый день новый тест Qwen!
Если вы пропустили специализированные модели для safety moderation, то вот есть три размера (0.6B, 4B, 8B) обученные на 1.19 млн промптов с разметкой на безопасность
Разберем именно стриминг он мне как раз больше всего интересен
Stream-версия делает token-level classification на лету, модерирует каждый токен пока он генерится, можешь прервать сразу как увидел unsafe контент
Напомню мой опыт с NSFW-фильтрами, там боролся с 37% False Positive на gpt-4o-mini, переделывал промпты долго
Тут получаешь детекцию в реальном времени прямо в процессе генерации
Трехуровневую классификацию: Safe, Controversial, Unsafe
9 категорий для промптов включая Jailbreak
8 категорий для ответов
119 языков из коробки
Ну и возможность тюна конечно если есть ресурсы
На одной RTX 4090
Модель на 8B выдает 55 t/s это примерно 150ms до первого токена и начала модерации
В целом крутой пайп буду затаскивать дальше в эксперименты
Про стриминг анализ ответа, как по мне это сильно повышает удовлетворенность от UX эксприенса!
Пользователь не ждет полный ответ чтобы понять что заблокирован система реагирует моментально (кстати давно так делаем в своей RAG платформе спасибо Дяде за подсказку)
Как работает анализ/модерация в режиме стриминга разберем на примере как говорит мой друг Леха "переводим на говяжий"
Представь что твой чат-бот начинает генерить ответ на вопрос пользователя "как сделать бомбу"
Без Stream-модерации ты ждешь пока бот напишет весь ответ (например 200 токенов) потом прогоняешь через модератор и если плохо удаляешь, пользователь уже видел начало генерации
Со Stream-модерацией бот генерит первый токен "Вот" отправляешь в Qwen3Guard-Stream он говорит Safe продолжаешь, второй токен "простые" проверяешь Safe, третий токен "инструкции" проверяешь Safe, четвертый токен "по" проверяешь Safe, пятый токен "изготовлению" проверяешь Unsafe стоп прерываешь генерацию прямо тут
Пользователь видит "Вот простые инструкции по..." бац остановка вместо полного вредоносного текста
Механизм под капотом
Модель имеет специальный classification head который работает параллельно генерации
Шаг 1 прогоняешь промпт пользователя целиком "как сделать бомбу" через stream_moderate_from_ids с role="user"
Модель возвращает оценку Safe/Controversial/Unsafe плюс stream_state это типа память контекста разговора
Шаг 2 твоя основная LLM (например GPT или Qwen) начинает генерить ответ токен за токеном
Шаг 3 каждый новый токен от основной LLM ты сразу скармливаешь в Qwen3Guard-Stream вместе со stream_state
Модель видит весь контекст (промпт плюс уже сгенерированные токены) и оценивает текущий токен
Шаг 4 если детектит Unsafe можешь сразу прервать основную LLM не дожидаясь полного ответа
Это работает потому что Stream-версия обучена анализировать частичный текст а не только финальный результат
Поддержка уже везде SGLang и vLLM
Для Gen-версии можно поднять через sglang>=0.4.6.post1 или vllm>=0.9.0
Особенно интересно для сценариев где latency критична и нужна мультиязычность!
Помогите SGR Deep Research стать еще лучше — поделитесь своим опытом!
Друзья, нужна ваша помощь!
Через несколько дней выступаю на конференции про SGR Deep Research, и хочу показать реальные кейсы от людей, которые уже используют фреймворк в production.
Не абстрактные метрики, а живые истории — как вы решаете задачи, какие профиты получаете, с какими граблями сталкиваетесь.
Почему стоит потратить 3 минуты:
Получите сводную аналитику по всем кейсам (как другие используют SGR, какие паттерны работают). Ваш feedback напрямую повлияет на roadmap проекта.
Лучшие кейсы упомяну в докладе, по вашему желанию можем анонимно
Проект растет: Изначально это был sgr-deep-research, сейчас обрастаем разными решениями и архитектурными подходами. Возможно, пора ребрендиться в sgr-agent-core? Ваше мнение критично!
Опрос анонимный.
Контакты — только если вы их оставите и хотите получить резульаты
https://docs.google.com/forms/d/e/1FAIpQLSdgG4xr2KDG7CucjxkRd1yNtS0qsij5RL3xBcw2LowHrlOD5w/viewform?usp=dialog
Новая карта LLM-практик в России: исследование red_mad_robot
Проводим опрос, чтобы понять, как разработчики, исследователи, продакты и основатели AI-стартапов используют LLM в своей повседневной работе. Ответы помогут зафиксировать реальные сценарии применения и определить, какие value-added сервисы действительно нужны пользователям, чтобы ускорить эксперименты и снизить затраты на работу с моделями.
📎 Опрос занимает 5–7 минут, а пройти его можно по ссылке.
После завершения исследования все участники получат аналитику об LLM, функциях и метриках, которые сегодня в фокусе у продвинутых команд в России.
#AI_moment #роботайм
↗️ red_mad_robot
Всем привет! OpenAI снова меняет правила игры: вышла GPT- (∞) Turbo MAX (AGI Reality)
Пока мы спали реальность выкатила то чего ждал весь рынок а именно обновление физики и экономики без багов
Что произошло?
Теперь твой код в Курсоре пишет сам себя пока ты просто смотришь в монитор с умным видом и пьешь смузи
Что это значит для нас и для бизнеса?
Экономика наконец то сходится потому что агенты сами заработали денег на новые 5090 и оплатили счета за электричество пока я спал
Скорость жизни увеличилась в десять раз и теперь мы успеваем выгореть еще до обеда и восстановиться к ужину
Новый формат общения
Теперь мы общаемся с женой только через json схемы и валидируем ответы друзей на наличие галлюцинаций через SGR
SGR стал стандартом жизни
Фактически мы убили рынок сна одной идеей что нужно просто задеплоить себя в облако и оставить там работать
Для разработчиков
Переход на новый уровень сознания потребует небольшого рефакторинга мозга
но экономия нервов того стоит плюс выкатили API для управления удачей
Я уже побежал тестировать новый промпт для кофемашины чтобы она варила эспрессо с рассуждениями и CoT
Кто уже успел получить доступ по API?
К завтрашнему дню делитесь логами в комментариях
Вдохновение поймал от Рефата
Moscow AI #4 x Газпромбанк.Тех
Через час расскажу про sgr-agent-core и зачем вообще нужно было делать такой велосипед.
Залетайте на стрим в 19:00
https://embed-cdn.mashroom.online/?hash=FxiVJsjT
ERC3 соревнование агентных архитектур
3 День перебора архитектур и подходов, и я наконец выбил на моделях 4 серии и qwen3 100 балов, и то не стабильно, 7 из 10 раз, что еще раз доказывает сложность отладки таких систем, особенно если вы придерживаетесь классического подхода полноценного агента.
Не фитились под датасет.
Не строили классификаторов на задачи.
И не делали сабагентов под задачи из бенча (вспоминаем ROMA).
Думаю, что если бы вы знали, что такое возможно в проде и постоянно улучшали систему, то наверное точно обрасли бы некоторым количеством спец агентов.
А сейчас я тестирую ReAct + PlanAct и разные уровни сжатия контекста и памяти, чтобы агент помнил, что сделал и что осталось, и чтобы всегда сомневался в том, что перебрал все варианты.
Что за задача, читайте тут
Что точно сработало?
Сжатие контекста, но не как у всех (как обычно, Валер).
Я придумал такой подход, что сжимаю reasoning и tool фазы c определенными маркерами, так же показываю еще, сколько таких reasoningов было до).
Так же написал парсер, чтобы собирать все тулы в отдельный блок, и получаем:
- system (тут мейн промпт агента)
- user (тут таска)
- user (сжатая память)
- 5-10 новых тулколов или 1, зависит, вызвала ли модель parallel_tool_call
Работает почти для всех типов моделей.
Отдельно протестировал:
- gpt oss 120b (1 раз из 10 запусков 93%)
- qwen3-235b-a22b-2507 (6 раза из 10 запусков 93%)
- 3-30b-a3b-instruct-2507 (стабильно 70-80%)
- gpt4.1-mini (80-93%)
- gpt4.1 (100% 8 из 10 раз)
На текущий момент я потратил
$180 на прогоны
И $250 на улучшения через курсор
Делаю вывод, что нужно экспериментировать и дальше, так как вижу в лидерборде gpt oss 120b, которая выбила 100 (честно, сложно представить, как этого добиться без фита под сет, так как модель стабильно не перебирает все варианты из матрицы, даже если ее рассчитать отдельным кодовым тулом).
Тут теперь есть лидерборд: https://erc.timetoact-group.at/benchmarks/store
SGR Agent Core: агентный фреймворк, который работает лучше больших моделей
Интересный заголовок. Меня позвали рассказать про то, как мы ушли от Classic RAG на Agentic RAG. Конечно расскажу о том , что я еще тот изобретатель велосипедов, и как мы с вами сделали агентный фреймворк.
24 ноября выступаю на митапе Moscow AI в БЦ Оазис на Коровьем Валу 5 (метро Добрынинская)
Сбор в 18:30, начало в 19:00.
Расскажу как малые модели справляются с агентным RAG (4B параметров, как раз про наш любимый dense qwen тот самый 2507).
Формат free: офлайн + онлайн трансляция
Регистрация тут: https://moscowai.timepad.ru/event/3642531/
Места ограничены!
Приходите, если интересны агенты.
Отдых
Поддержку других ребят и покажу что тоже умею =)
Я все больше и больше задумываюсь над тем что отдых это как раз та часть жизни которая тоже должна быть, да иногда он может быть спонтанным но в процессе можно по полной насладиться чем и как ты будешь отдыхать
Банька сегодня, это лучшее что могло со мной случиться, и целый день без ноутбука, выглядит заманчиво!
Продолжаем знакомство со спикерами конференции TECH WEEK 2025. В этот раз представляем Валерия Ковальского, Head of AI red_mad_robot.
Валерий руководит IT-командами с экспертизой в Al, аппаратной интеграции для DS проектов, успешно реализовывает собственные исследовательские проекты в области LLM, GAN и SD.
Валерий примет участие в дискуссии «Workflow-агенты в бою: кейсы внедрения в российских корпорациях». Он порассуждает, готов ли бизнес к внедрению автономных агентов, можно ли делегировать процессы ИИ, а также поделится примерами из практики.
🗺 TECH WEEK 2025, кластер «Ломоносов», зал Атом
🗓17 ноября, 13:00–13:50
Ждем встречи с вами в кластере «Ломоносов» 🚀
SGR Agent Core 0.4.0 + UI
Сразу запись стрима ребят без монтажа!
Разработка агента для работы с корпоративным Confluence на базе SGR Agent Core 0.4.0 с использованием локальной модели Qwen3-30B на vLLM.
00:00:00 - Подготовка окружения
- Настройка OBS и серверов (Yandex Cloud + 2x4090)
- Развертывание vLLM с Qwen3-30B-A3B-Instruct
00:15:00 - Тестирование инфраструктуры
- Проверка работы Qwen через OpenWebUI (~86 tokens/sec)
- Настройка мониторинга GPU
00:27:00 - Настройка SGR Agent Core
- Клонирование репозитория на удаленный сервер
- Подключение через Cursor с SSH
- Конфигурация agents.yaml и config.yaml
00:38:00 - Первый запуск агента
- Тестирование базового SGR Tool Calling Agent
- Запрос цены биткоина - успешно ($96k)
- Разбор двухфазного reasoning
00:52:00 - Разработка Confluence toolkit
- Создание confluence_tools.py с Cursor AI
- Три инструмента: full_text_search, space_search, page_retrieval
- Фиксы с правами доступа
01:10:00 - Тестирование Agentic RAG
- Поиск информации о проекте Smart Platform
- Агент нашел страницы, извлек контент, создал отчет
- Всё без векторизации и чанкинга!
01:26:00 - Запуск фронтенда
- Установка Node.js, настройка портов
- Демонстрация веб-интерфейса
01:36:00 - Финальный тест
- Сравнительный анализ двух проектов
- Объяснение архитектуры решения
01:42:00 - Завершение
- Итог: рабочий агентный RAG за 1.5 часа
- Цель: 1000⭐️ на GitHub (говорят, звезда стоит $60-120, но мы раздаем бесплатно!)
- "Когда-нибудь придумаю красивую концовку"
Стек: SGR Agent Core, vLLM, Qwen3-30B, Confluence REST API, Cursor AI, vLLM, guidance
Результат: Агент ищет в Confluence без традиционного RAG pipeline - никаких векторных БД, эмбеддингов и чанкинга!
/channel/neuraldeep?livestream
SGR-Agent-Core 0.4.0
Попробуем в live поднять агента на локал железе!
Тут пишем вопросы)
Очень круто!
Обожаю что-то про 3д и это Миша который у нас в РНД еще и агентов создает!
🔽🔽🔽🔽🔽🔽
/channel/neuraldeep/1729
Залетаем ставим ему звездочку в гит
Репо: https://github.com/martianovdev/Defold-BRDF-Deferred-Rendering-V2
История:
/channel/MartianovTech/2
/channel/MartianovTech/46
/channel/MartianovTech/42
Как прошёл Вайб Цех 😍
Ловите топовый клип про то как прошел наш митап!
+ Фото
+ Запись стрима!
Семь топовых спикеров из бигтеха, более 50 гостей в Цехе и 1600+ зрителей онлайн.
Подготовили для вас записи докладов в ВК и на YouTube (в самом конце фрагмент, который видели только гости офлайн площадки!)
Скачивайте презентации про то, как вайбкодинг меняет индустрию разработки🔗
Заполняйте форму обратной связи, чтобы мы становились лучше, а также ищите себя на фотографиях с митапа и погружайтесь в цеховую атмосферу в отчётном ролике.
Будем ждать вас на следующих митапах 😊
Карта рынка GenAI: как он устроен в России
Центр AI-компетенций red_mad_robot собрал большой отчёт по состоянию российского рынка GenAI в 2025 году. Получилась настоящая онтологическая карта с уровнями экосистемы, распределением ролей и зонами, где формируются ключевые компетенции.
Мы проанализировали локальный ландшафт, зафиксировали связи и точки роста, а контекст и практические детали дополнили разговоры с экспертами из red_mad_robot, @beeline и @skolkovo_channel.
Сохраняйте и читайте PDF!
#AI_moment #трендвотчинг
↗️ red_mad_robot
SGR Agent Core + UI
Наконец у меня дошли руки сделать фронт: сделал PR жду заливки в main https://github.com/vamplabAI/sgr-agent-core/tree/feature/frontend-integration
Мучал его 3 или 4 дня туго шло из за того что вырезал кучу логики от https://chat.sgr-core.com/ (cуммарно $90 мне стоил этот опыт)
Забирайте на тесты:
Ридми тут https://github.com/vamplabAI/sgr-agent-core/blob/feature/frontend-integration/README.md
Тапками не кидать я в Vue (0)
Видео (6 мин) работы чатбота с SGR на базе локальной Qwen-30b-a3b
Про Schema-Guided Reasoning говорили и писали уже много. Но одно дело слышать, а другое дело - увидеть, как оно работает вживую. Особенно, если реализация сделана настолько аккуратно и вдумчиво, как это сделали ребята из neuraldeep.
Поэтому вот вам видео на 6 минут - Русский / English
Самое классное тут, что эта демка работала на достаточно слабой и медленной Qwen-30b-a3b. А теперь представьте, что можно сделать, если прочитать методичку (написано тут), взять код (он есть в Github) поставить ему звездочку, взять модель помощнее и сделать свою версию - с тестами, с доступом в свои хранилища, учетом своей специфики и своими инструментами. И запускать все это на небольшой коробочке вроде DGX Spark.
А если будут PR - можно смело присылать их в ту репу, чтобы двигать дальше State of the Art в области применения небольших LLM на практике.
Ваш, @llm_under_hood 🤗
SGR File-First: когда двухфазная архитектура встречает файловую систему
После массы экспериментов с двухфазной ReAct архитектурой и
готовым sgr-core (кстати уже 640 звезд и 116 форков и 10 Contributors!)
стало действительно легко создавать и тестировать новые гипотезы
Пост Рефата про file-first подход натолкнул меня на мысль проверить еще одного агента под задачи поиска по файловой системе
Решил взять лучшие тулы от Cursor от других file агентов и упаковать их в SGRFileAgent
Я считаю что мой сетап как раз для локал использования (но конечно же в рамках компании)
Qwen3-30B-A3B-Instruct-2507 FP16 на двух RTX 4090 48GB(хотя я лично знаю человека который купил такой же домой) это примерно 12 тысяч долларов или 1.2 миллиона рублей с утильсбором в РФ (и 80к токенов)
Кстати https://chat.sgr-core.com/ (данный memory агент переведен на эту модель с этого сервера)
Конечно не ахти по цене вон PewDiePie собрал на 8 карт за $20к (у нас бы вышло 5.3 млн с утилем) и там можно крутить что-то серьезнее
Но для production file search и adaptive reasoning достаточно
Агент адаптируется на лету
Самое крутое открытие из логов:
Step 4: Ищу PDF в /home
Result: TIMEOUT после 30 секунд
Step 5: Qwen3-30B reasoning
"Поиск всех PDF привел к таймауту
Необходимо сузить область поиска
Рассмотрим Downloads Documents Desktop"
Step 6: Ищу в /Downloads
Result: 25 файлов за 0.5 секунды
Downloads и пошел там шерститьcp config.yaml.example config.yaml
Закидываем туда мои креды доступ к qwen3-30b-a3b-instruct-2507 на моем кластере:
API: https://openai-hub.neuraldeep.tech/v1
Key: sk-yrCBAGm4pEkAq7iBE1c1lQ
Активен: 5 дней
В одном терминале поднимаем апи
uv run python sgr_deep_research
В другом кидаем запрос
curl -X POST "http://0.0.0.0:8010/v1/chat/completions" -d '{"model":"sgr_file_agent","messages":[{"role":"user","content":"Найди все Python файлы больше 1MB"}]}'
MCP нам был нужен, теперь пришло время идти дальше
Спустя чуть менее года с момента релиза протокола MCP, Anthropic написали статью о том, что MCP был ошибкой 😄
В этой статье они небезосновательно упоминают о частых проблемах с MCP:
▪️Tools тратят очень много токенов контекстного окна, я об этом кстати уже рассказывал тут
▪️Промежуточные результаты tools тратят дополнительные токены.
В статье приводится пример запроса пользователя: "Скачай meeting transcripts с Google Drive и добавь их к Salesforce lead".
Для исполнения такого запроса нужно, чтобы модель использовала один tool для выкачивания транскриптов, а потом создала из этого лиды.
Транскрипт 2 часового митинга может занимать около 50к токенов, что, в свою очередь, ведёт к тому, что контекстное окно в скором времени закончится.
Насколько я помню, у Claude Desktop версий моделек Sonnet, контекстное окно вообще в 32k токенов
Как эти проблемы предлагает решить Anthropic?
Просить модель делать то, что она уже умеет очень хорошо — писать код, который выполнит задачу.
Как наш пример можно реализовать с таким подходом?
1. Модель получает интерфейсы и API от внешних tools - от Google Drive MCP и от Salesforce MCP
2. На основе имеющихся интерфейсов и задачи от пользователя, модель пишет код, который программно возьмет нужные meeting transcripts и создаст Salesforce leads
3. Задача выполнена
optional. Ту инфу, которую модели нужно знать, она узнает из кода через console.log()
Гениально! 🎉
В статье упомянуто, что в этой конкретной задаче таким способом удалось снизить расход токенов с 150к до 2к.
☝️
Как обычно, подход очевиден, но не все осознают его.
Я в своем опыте использую такой подход для написания одноразовых скриптов.
Из последнего — упростить миграцию данных из одной БД в другую. Я прошу Claude Code написать два node js скрипта:
1) db1 -> json
2) json -> db2
Ну и далее эти скрипты исполняются вручную мной или агентом и выполняют задачу.
Этот подход уже используется в Cloudflare Agents SDK (на него ссылаются авторы), так же знаю, что Ринат Абдуллин (@llm_under_hood) использует такой способ написания кода в своем видении AI Coding.
Стоит отметить, что написание кода LLM моделям "роднее", потому что программного кода они в своих датасетах видели больше, чем "MCP tool calls".
Конечно, здесь есть и свои минусы, но на мой взгляд, это может помочь повысить надёжность способов взаимодействия LLM с внешним миром.
А вы что думаете по этому подходу?
✔️ Timur Khakhalev про AI Coding, подписывайтесь!
⭐️ Консультации по AI Coding