14059
Head of AI redmadrobot.com From IT Admin to Head of AI in 5 years Applied AI Engineer B2C RAG (2M+ books) B2B RAG platform (10+ implementations) B2C gptdaisy.com (100k MAU) github.com/vakovalskii | chat @neuraldeepchat To infinity... and beyond!
Присоединяюсь к поздравлениям моего собутыльника Леши Жданова
Миша получил грант от Yandex Open Source (оч круглую сумму я скажу) за свой проект faster-coco-eval
— ускоренную версию оценки детекции объектов 🚀
Почему это важно?
— Опенсорс делает технологии быстрее и доступнее.
— Такие проекты, как этот, помогают исследователям и разработчикам экономить время.
— Поддержка компаний вроде Яндекса мотивирует развивать open-source.
Миш, поздравляю тебя
Подборка сервисов для быстрой оценки и сравнения LLM
Открытых моделей становится всё больше, а универсального ответа, какую ставить в продукт — нет. Одним важна точность, другим — стоимость, масштабируемость или устойчивость на длинных запросах.
Сравнительные сервисы упрощают этот выбор: они фиксируют поведение в реальных сценариях, агрегируют пользовательские оценки и показывают, какие решения уже в продакшене. Собрали подборку таких платформ.
1️⃣ OpenRouter: рейтинг LLM по реальному использованию
OpenRouter публикует открытый рейтинг моделей, основанный на частоте их использования в реальных продуктах. Это не лабораторные тесты, а фактические данные из прикладных сценариев: кодинг, маркетинг, финтех, технологии.
Рейтинг можно фильтровать по задачам и периоду: за день, неделю, месяц или по росту популярности. Это рыночный барометр: если модель стабильно удерживает лидерство в вашей категории — её используют в продакшене.
2️⃣ Chatbot Arena (LMSYS): парные сравнения моделей
Платформа предлагает формат арены: пользователь задаёт вопрос, а две модели отвечают параллельно. После этого выбирается лучший ответ. По итогам сравнений формируется рейтинг по системе Elo — как в шахматах, только для LLM.
Для моделей на русском языке есть аналог — LLM Arena. Сервис также поддерживает сравнения, голосование за лучший ответ и динамический рейтинг. Включены YandexGPT, GigaChat, MTS AI и другие модели.
3️⃣ Hugging Face: рейтинг по независимым бенчмаркам
В отличие от рейтингов популярности или пользовательских голосов, Hugging Face оценивает модели по результатам стандартных тестов: MMLU (общие знания), BBH (логика), IFEval (следование инструкциям), кодингу, математике и другим. Каждая модель получает баллы по ряду метрик, по которым можно отсортировать модели.
4️⃣ MERA: открытый бенчмарк для русскоязычных LLM
Лидерборд ранжирует модели по результатам фиксированного набора задач: логика, код, знания, этика. Оценка проходит в равных условиях: стандартизированные промпты, единые параметры, открытая методика.
Подходит, если вы работаете с русскоязычными моделями, и вам важна применимость и эффективность в конкретной области.
Какие выводы?
Выбор LLM — это управленческое решение с последствиями для качества, стоимости и скорости продукта. Сравнительные платформы не заменяют пилоты, но позволяют действовать быстрее и точнее:
📍 Отсекать слабые решения до интеграции
📍 Фокусироваться на моделях, которые уже работают в продакшене
📍 Оценивать зрелость open-source вариантов без риска потерь в качестве
Если вы внедряете LLM в продукт, рейтинги помогают действовать не по наитию, а по обоснованным критериям. Но важно не полагаться на один источник — первичную кросс-оценку стоит строить на данных из разных сервисов.
#AI_moment
@Redmadnews
Международный вояж #безвотэтоговотвсего продолжается и мы возвращаемся в наш любимый Баку!
На нашей пятой встрече сообщества в этом прекрасном городе мы решили взять тему, которая точно не оставит равнодушным никого из тех, кто хоть чуть-чуть связан с технологиями (а есть ли другие в 2025 году?).
Тема нашей встречи - “Мир после GPT: как AI меняет рынок IT и продуктов навсегда?”. Ведь здесь, помимо хайпа, просто море интересного:
⁃ Что именно изменилось в работе IT и продуктовых команд с приходом AI?
⁃ Что теперь значит "быть профессионалом"? Раньше — знания и опыт. Сейчас — умение работать с ИИ?
⁃ Что произойдет с ощущением профессиональной идентичности? Кто я, если мои навыки заменяемы моделью?
⁃ Какие новые этические дилеммы появляются с развитием AI? Если GPT написал код с багом — кто виноват?
⁃ Почему middle-специалисты стоят как senior, если GPT делает их работу?
⁃ и многое другое )
На эту тему собрались поговорить прекрасные эксперты:
⁃ Сергей Рыжиков, основатель Битрикс24
⁃ Иван Самсонов, CPO of AI, MTS Web Services
⁃ Валерий Ковальский, Head of AI red_mad_robot
⁃ Валех Набиев, CDO at Pasha Holding
Состав уникальный и точно позволяющий разобрать вопрос с разных сторон.
Обязательно регистрируйтесь и сохраняйте билеты.
Встречаемся 03 июня в 18:30 JW Mariott Absheron (674 Azadliq Square).
Будет огненно!)
Smart Platform - наша on-premise RAG платформа
Врываюсь с двух ног почти готовым релизом нашего внутреннего продукта (а за плечами 7 месяцев исследований реальных интеграций и разработки)!
Нет ничего приятнее рабочих якорей (ссылок на источники, которые подсвечивают информацию в нужной вам интеграции, использовавшуюся при ответе LLM), которые показаны на нативной интеграции с Confluence в закрытом контуре
И еще больше кайфую, что это уже работает не только в теории, но и на наших внутренних тестах на демо стенде!
Такой RAG может работать и на моделях до 10b (LLM), а значит, сервер для корпоративного RAG начинает стоить адекватных денег
Целая цепочка router-агентов и долгий путь изучения лучших подходов и фреймворков для Q&A и диалоговых RAG-систем для закрытого контура
За всеми апдейтами по продукту предлагаю следить тут в канале нашего CPO Леши Жданова
Материалы по Cursor
🔥 Рекомендуемые ресурсы:
• My LLM codegen workflow
• Как заставить ИИ работать в устаревших кодовых базах
• Видео-гайд по Cursor
📚 Дополнительные материалы:
• Awesome Cursor Rules
• A Structured Workflow for "Vibe Coding" Full-Stack Apps
• Гайд по вайб-кодингу от Anthropic
💡 Мнения:
• Почему я перестал использовать редакторы кода на основе ИИ
• Как заставить AI писать качественный код?
• Вся правда про Cursor
🔗 Официальные ресурсы:
• Документация
• Форум
Почему бизнес уходит от универсальных AI-решений к мультиагентным системам
Подключить LLM, загрузить базу знаний, настроить поиск по документам — кажется, что этого достаточно. Но на практике сложные запросы выходят из контекста, ответы размываются, а вместо решений система предлагает «посмотреть документацию». Там, где бизнес ждёт точности и конкретики — универсальный AI не справляtтся.
Вместе с руководителем направления искусственного интеллекта в red_mad_robot Валерой Ковальским разбираем, как мультиагентная архитектура закрывает эти пробелы: помогает обрабатывать сложные запросы, снижает нагрузку на команды и даёт измеримый эффект в бизнес-процессах.
↗️Читайте свежий кейс на Habr
#AI_moment
@Redmadnews
n8n + Qwen 2.5 7b instruct + vLLM + SO = Мощный диджитал твин на своем железе!
Всем привет!
По следам экспериментов я решил собрать небольшой пост старт по тематике n8n здорового человека
Что это такое?
Low-code подход через n8n для построения логики "диджитал твина"
vLLM для оптимизации инференса модели на локальной инфре + под капотом есть xgrammar
Qwen 2.5 7b instruct(t-lite) - неожиданно эффективная для SO и классификации интентов под такие задачи
Интеграция с RAG Smart Platform как "знаниевый агент" в наборе инструментов
Как это работает?
Structured Output вместо встроенных агентов которые работат на tool которые ломаются чаще российского автопрома для классификации намерений
Гибкая архитектура инструментов через n8n ноды(пришлось попотеть через js Vibe Coding спасает)
Маршрутизация запросов на основе четкой классификации где нет места гибким условиям если есть только flow!
Интеграция с внешними API и базами знаний
Что сейчас умеет такой спрут? Причем n8n стоит локальной на моем сервере
Выбор инструмента на основе намерения пользователя
Роутинг между различными исполнителями задач
Универсальный метод для разных типов запросов (часто без необходимости переобучения модели)
Форматирование запросов от каждой внешней АПИ типо погоды или календаря под тот формат который я задумал для визуализации пользователю!
Система не идеальная, но уже можно автоматизировать множество процессов!
Если вам интересно то этот пост байт на коменты и реакции
Хочу понять стоит ли пилить отдельный пост разбор + выложить код всех нод на гит для повторения!
Смотрите чё выпало из недр моей тумбы, тогда мне точно было не до AI
Аж олдскулы свело на моменте покупки рингтонов через sms
UI-Browser LLM automation песочница для автоматизация браузера на базе LLM
Давно обещал вылить свой форк тут показывал прошлые наработки browser-use-web-ui да еще и в одном из чатов попросили
Все внутри просто
docker compose up -d
Почему я считаю, что RAG это call?
Пару часов назад Александр на своем канале Dealer AI снова обратил внимание на RAG-системы с точки зрения важности тестирования и оценки метрик до внедрения указанных систем в продакшен.
Я полностью разделяю эту точку зрения и всегда прошу заказчиков, по возможности, предоставлять хотя бы общий тестовый датасет, на базе которого можно будет выполнить предварительную оценку точности работы проекта и произвести его тонкую настройку до публичного релиза.
Как-то раз общался с заказчиком по одному проекту и пытался объяснить ему важность предварительного сбора бенчмарков для оценки качества системы. Логика у меня была простая: если предположим, некая RAG-система состоит из трёх последовательных звеньев (эмбеддер, ретривер, LLM), каждое из которых имеет точность, скажем, 90%, то интуитивно кажется, что и общая точность будет примерно на том же уровне. Однако на самом деле всё сложнее.
Согласно теории надёжности, в последовательных системах ошибки наследуются, и итоговая точность определяется перемножением точностей всех звеньев. Если каждый из трёх модулей даёт точность 90% (0.9), то реальная точность системы будет равна:
0.9 = 0.9
0.9 * 0.9 ≈ 0.81 (81%)
0.9 * 0.9 * 0.9 ≈ 0.729 (72.9%)
0.9 * 0.9 * 0.9 * 0.9 ≈ 0.656 (65.6%)
0.99 * 0.9 * 0.7 ≈ 0.623 (62.3%)
Smart Platform - наша on-premise RAG платформа
Врываюсь с двух ног почти готовым релизом нашего внутреннего продукта (а за плечами 7 месяцев исследований реальных интеграций и разработки)!
Нет ничего приятнее рабочих якорей (ссылок на источники, которые подсвечивают информацию, использовавшуюся при ответе LLM), которые показаны на нативной интеграции с Confluence в закрытом контуре
И еще больше кайфую, что это уже работает не только в теории, но и на наших внутренних тестах на демо стенде!
Всё на моделях до 10b (LLM), а значит, сервер для корпоративного RAG начинает стоить адекватных денег
Целая цепочка router-агентов и долгий путь изучения лучших подходов и фреймворков для Q&A и диалоговых RAG-систем для закрытого контура
За всеми апдейтами по продукту предлагаю следить тут в канале нашего CPO Леши Жданова
Почему бизнес уходит от универсальных AI-решений к мультиагентным системам
Подключить LLM, загрузить базу знаний, настроить поиск по документам — кажется, что этого достаточно. Но на практике сложные запросы выходят из контекста, ответы размываются, а вместо решений система предлагает «посмотреть документацию». Там, где бизнес ждёт точности и конкретики — универсальный AI не справляется.
Вместе с руководителем направления искусственного интеллекта в red_mad_robot Валерой Ковальским разбираем, как мультиагентная архитектура закрывает эти пробелы: помогает обрабатывать сложные запросы, снижает нагрузку на команды и даёт измеримый эффект в бизнес-процессах.
↗️Читайте свежий кейс на Habr
#AI_moment
@Redmadnews
MoscowJS 64 x red_mad_robot⚡️
15 мая встречаемся на митапе в Робохранилище в Москве.
Поговорим про качество кода, стандарты и то как это влияет на разработчиков и команды. Будем постепенно рассказывать про наших спикеров — следите за обновлениями здесь и в чате сообщества @moscowjs
🕔15 мая, четверг, стартуем в 19:00
📍Москва + онлайн
🔗Регистрация по ссылке.
До встречи 🟥