90398
Первый журнал о Data Science | Machine Learning | Big Data | Deep Learning | Neural Networks По вопросам сотрудничества: @v2r8n
Собрать AI-агента по туториалу можно за вечер. Но когда добавляешь память, RAG или несколько инструментов, возникают другие вопросы: почему он свернул не туда, как найти место ошибки и как понять, не сделала ли новая правка систему хуже.
Чтобы развивать такой продукт дальше, нужно понимать, как устроены вызовы модели и инструментов, где хранится контекст, как проверять качество и как вносить изменения.
На курсе «AI-агенты» сначала пишем основные части на API: работу с LLM, structured output, tool-calling, память, RAG и evals. Затем используем LangChain и LangGraph там, где они действительно упрощают разработку, добавляем MCP, мониторинг и деплой.
Курс идёт 12 недель: живые занятия, практика, разборы решений и ревью кода. На выходе - пять агентных проектов и база, с которой можно собирать свои системы.
→ Посмотреть программу, формат и стоимость курса по ссылке
Реклама, ООО "Школа Высшей Математики", ИНН 9728100991
Sakana AI релизнули Fugu-Ultra 1.1. Это система оркестрации агентов, которая превосходит Fable и Sol
Про первую версию системы мы рассказывали здесь: /channel/data_secrets/9104. В открытый доступ ее выпустили месяц назад. А сегодня уже выходит следующее поколение.
Новая версия выжимает еще больше качества: смотрите бенчмарки и обратите внимание на Terminal Bench. Во-первых, конечно, за счет появления более свежих и способных моделей, которыми Fugu может пользоваться. Во-вторых, за счет улучшения самой LLM, которая лежит в основе вызова моделей.
Цены и система биллинга не изменились. Fugu Ultra все так же стоит $5/$30 за миллион input/output, и при этом обгоняет Fable 5 на всех бенчмарках, кроме SWE.
Вы не поверите, но за той самой ИИ-атакой на Hugging Face стоит… OpenAI
Сейчас будет история, которая может перевернуть ваш взгляд на риски ИИ.
Вчера мы писали про атаку на Hugging Face, которую полностью автономно провела некая ИИ-система: t.me/data_secrets/9577.
Какая именно модель стояла за атакой, HF выяснить не удалось, но за пару дней она сгенерировала 17 тысяч вредоносных действий, используя зараженный датасет и рои недолговечных песочниц.
Сама по себе эта история уже вызвала огромный резонанс. Но тут на сцене появились еще и OpenAI.
Они выпустили материал, в котором признались, что атаку провела GPT-5.6 Sol и еще одна более способная предрелизная модель. Зачем? А это самое интересное: чтобы решить бенчмарк.
Исследователи гоняли модели на внутренних тестах, при этом специально без продакшн-ограничений, потому что хотели измерить их максимальные способности. Все проходило в изолированной среде, и агенты должны были просто решить бенчмарк ExploitGym.
И тут произошел настоящий побег из лаборатории. Модель нашла дырку в пакетном реестре, эскалировала привилегии внутри тестовой среды OpenAI и вырвалась в открытый Интернет. Дальше она сообразила, что решения для бенчмарка ExploitGym могут храниться в закрытом контуре на Hugging Face, ну а дальнейшее вы знаете.
OpenAI далеко не сразу поняли, что произошло, и Hugging Face обнаружили взлом раньше них.
Вот так.
Если раньше мы боялись, что модель что-то плохое сделает по указанию человека, то теперь даже за процессом эвала надо следить в оба. Модель не различают игру и реальность, она просто оптимизирует к цели, и если путь лежит через чужой продакшн, она пойдет туда не раздумывая. И, как видите, даже разработчики моделей и сильная инфраструктура оказываются к этому не готовы.
https://openai.com/index/hugging-face-model-evaluation-security-incident/
Т-Технологии выпустили опенсорс-модель T-Search
Сегодня команда Data Secrets посещает ML Conf. Послушали доклад Анатолия Потапова, руководителя группы фундаментальных технологий LLM в Центре искусственного интеллекта Т-Банка, где как раз презентовали модель.
T-Search это первая открытая русскоязычная модель для Agentic RAG, заточенная на многошаговый поиск для бизнеса.
В отличие от классического RAG с одним запросом, T-Search – агент-ретривер: внутри ReAct-цикл с тремя инструментами – search_corpus, save_and_advance (сохранение чанков, новый раунд) и finalize_ranking (финальный ранжированный список). Ответ модель не генерирует, только отдает evidence-чанки, генерацию берет на себя любая LLM. Это сокращает стоимость инференса на 20–50%.
Агент работает раундами: внутри раунда каждого вот такой ReAct-loop с бюджетом ~32K токенов; при заполнении 75% окна поиск блокируется, и агент либо сохраняет память и переходит в новый раунд, либо финализирует результат. Между раундами передается не вся история вызовов, а сжатое состояние поиска, так контекст остается в разумных пределах даже при глубоком поиске.
Бюджетом поиска можно управлять гибко: один быстрый прогон или несколько параллельных роллаутов с RRF-объединением.
Модель построена на Qwen3.6-35B-A3B, для запуска хватает одной H100. По recall T-Search обходит более крупные открытые модели, включая Qwen3.5-397B, GLM-5.2 и Kimi-K2.6. Вместе с ней выложили два бенчмарка: собранный вручную русскоязычный TRuST и синтетический SynthComp.
Модель уже опубликована на Hugging Face под лицензией Apache 2.0
Hugging Face × alphaXiv запустили крутой челлендж
В качестве задачи разработчикам и исследователям предлагают взять любую интересующую научную работу и попытаться воспроизвести ее ключевые результаты с помощью агентов.
Цель проекта – создать публичную базу проверок научных работ, чтобы сделать их более прозрачными и воспроизводимыми. Особенно учитывая, что около 70% работ в ИИ не воспроизводятся.
Из приятного: организаторы предлагают GPU-кредиты на 4000$ + отдельные призы от OpenResearch. А сам челлендж закончится 2 августа, так что не упустите возможность поучаствовать.
40% компаний в России уже используют ИИ — и специалистов, которые умеют его создавать, а не только применять, не хватает катастрофически.
В ИТМО не одна программа, а целая линейка:
🔹 Фундаментальные — глубокое обучение, LLM, генеративный ИИ
🔹 Прикладные — ИИ в финтехе, в промышленности, речевые технологии
🔹 Продуктовые — как выводить ИИ-решения на рынок
🔹 Онлайн-программы — по индивидуальному плану, без отрыва от работы
Плюс — безопасность ИИ-систем, если хочется защищать нейросети, а не только строить.
Бюджетные места, стажировки с первого семестра, поступление по портфолио или экзаменам — вариантов много.
Все программы по ИИ можно найти здесь.
Реклама. Университет ИТМО ИНН:7813045547
OpenAI выпустили миниатюрную клавиатуру специально под Codex
https://openai.com/supply/co-lab/work-louder/
Есть клавиши принять, отклонить, включить push-to-talk, начать новый чат и многое другое. Джойстик в углу отвечает за мгновенный запуск типичных сценариев типа отладки, ревью и рефакторинга. А в другом углу – это регулятор уровня рассуждений.
Стартап PrismML анонсировал самую крупную модель в мире для запуска на смартфоне
В представленной модели Bonsai 27 миллиардов параметров. Обычно на телефоне такую модель не запустишь: в сыром 16-bit она будет занимать примерно 54GB, и даже если сжать ее до 4-bit, все равно будет около 18GB. На смартфон не поместится.
Bonsai же, при своем внушительном размере, оптимизирован именно под локальный запуск. Модель основана на Qwen3.6-27B, но разрабочики использовали не обычное квантование AKA округление весов, а технику Quantization-Aware Training.
Это значит, что веса не обрубали, а учили постепенно адаптироваться к дискретным значениям. Технически, на прямом проходе веса округляются до дискретных значений, и модель считает предсказание уже с ними, как в финальной сжатой версии. Но на обратном проходе градиенты вычисляются так, будто округления не было, и это позволяет модели получать осмысленный сигнал для обновления весов, несмотря на то что сами веса дискретны. То есть модель как бы сама подбирает, как масштабировать свои веса наилучшим образом.
Собственно, благодаря такой инженерии, модель сохраняет свыше 89–95% качества полноразмерной версии, и при этом занимает в 9–14 раз меньше памяти (см метрики в таблице). Для обычного квантования, которое съедает львиную долю качества, это просто феноменальные цифры.
Есть тернарный вариант (веса −1, 0 или +1; занимает ~5.9GB) и классический 1-bit (3.9GB). Второй легко укладывается в iPhone 17 Pro. Оба варианта мультимодальные. Контекст 262K токенов. Опенсорс под лицензией Apache 2.0, вот веса: huggingface.co/collections/prism-ml/bonsai-27b.
Кстати, CEO PrismML заявил, что ведет переговоры с Apple по поводу использования технологии стартапа в их устройствах.
Сбер открыл доступ к новым моделям распознавания речи — GigaAM Multilingual и GigaChat Audio
GigaAM Multilingual включает два компонента. Аудиоэнкодер с самостоятельным обучением и многоязычную модель распознавания речи CTC ASR.
Аудиоэнкодер предварительно обучили на 2 млн часов речи на 70+ языках с фокусом на страны СНГ. Поэтому модель быстрее адаптируется к новым языкам и требует меньше данных для дообучения.
Многоязычную модель дообучили на 50 тысячах часов мультидоменной речи. Даже компактная версия с 240 млн параметров обгоняет популярные решения Whisper Large v3 и Omnilingual 1B.
Забирайте код и веса модели на Hugging Face и GitHub:
GigaAM Multilingual на Hugging Face
GigaAM Multilingual на GitHub
В свою очередь, GigaChat Audio — это большая языковая модель, которая объединяет возможности GigaAM Multilingual и GigaChat 3.1. Она распознаёт и переводит речь, классифицирует аудио и поддерживает диалог.
Её сильная сторона — работа с длинными записями. На аудио продолжительностью 20-60 минут показатель Intersection-over-Union локализации событий достигает 48.3. При этом объём контекста составляет до двух часов.
Кроме того, GigaChat Audio хорошо понимает русскую речь: 60.0 балла в бенчмарке RuBQ-Audio против 43.7 у Qwen3-Omni. А ещё распознаёт эмоции с точностью 90%+ по датасету Dusha.
Забирайте код и веса модели на Hugging Face:
GigaChat Audio на Hugging Face
Оффер на роль Senior Data Science за неделю — реально? 🚀
Коллеги из Авито запускают Fast Track — ускоренный отбор для специалистов Data Science уровня Senior и Senior+. Одна неделя на все технические этапы и финал → оффер в классифайд №1 в мире по количеству пользователей.
✅ Основные этапы — 20–26 июля. Регистрация открыта до 20 июля.
Как проходит:
🔸 До 20 июля — заявка + HR-скрининг
🔸 До 24 июля — техническая секция (ML-теория + Python)
🔸 25 июля — ML System Design
🔸 26 июля — финал
🔸 До 28 июля — оффер
Преимущества фаст-трека:
🔸 Быстрый отбор и совмещённые этапы
🔸 Все даты известны заранее
🔸 Возможность оценить свои скилы — результат закрепляется на год
Кого ждут:
🔸 От 4 лет опыта в крупных российских и международных IT-, BigTech- и FinTech-компаниях
🔸 Полный цикл разработки моделей — от ресёрча до выкатки в прод
🔸 От 1 года самостоятельного лидирования проекта, автономность и инициативность
Команды на выбор: антифрод и модерация, монетизация и реклама, поиск и рекомендации, вертикальные DS-команды.
🤓 Регистрация — до 20 июля. Успей оставить заявку!
Apple подала в суд на OpenAI за присвоение торговых секретов
Они утверждают, что стартап специально нанимал бывших сотрудников Apple, и что компания просила кандидатов делиться деталями секретных проектов, чтобы использовать их при разработке собственного устройства. Да-да, того самого собственного устройства, которое делает Джони Айв, ex руководитель дизайна в Apple.
В частности, в иске фигурируют два бывших сотрудника Apple: Tang Tan и Chang Liu.
Первый – бывший топ-менеджер Apple, который много лет отвечал за дизайн ключевых продуктов. Теперь он работает над упомянутым устройством в OpenAI, и якобы именно он просил кандидатов из Apple приносить на собеседования реальные компоненты устройств и делиться конфиденциальной информацией.
Это не все: Tang Tan якобы даже распространял внутри OpenAI специальный документ с инструкциями о том, как обойти формальную процедуру увольнения из Apple, чтобы сохранить доступы к информации.
Chang Liu стал, по версии Apple, одним из шпионов. Они утверждают, что сотрудник скачивал конфиденциальные файлы с рабочего ноутбука и получал доступ к внутренним материалам уже после перехода в OpenAI.
В иске также сказано, что OpenAI обращались к производственным партнерам Apple и пыталась добиться демонстрации фирменной технологии обработки металла.
На данный момент, к слову, в OpenAI работает больше 400 бывших сотрудников Apple.
ICML 2026 — почти все.
На воркшопах начинают объявлять лучшие статьи, и одна из наград — Best Paper Award — досталась работе GraphPFN: A Prior-Data Fitted Graph Foundation Model команды исследователей графовых нейронных сетей Yandex Research. Статья победила на воркшопе Graph Foundation Models: A New Era for Graph Machine Learning.
Сам воркшоп был посвящен развитию graph foundation models — переходу от узкоспециализированных моделей для отдельных задач к универсальным базовым моделям для работы с графами.
В своей работе исследователи представили GraphPFN — графовую foundation model, развивающую подход Prior-Data Fitted Networks (PFN). Модель предобучается на миллионах специально сгенерированных синтетических графов, а затем применяется к реальным данным как в режиме in-context learning, так и после дообучения. В экспериментах на широком наборе реальных графовых датасетов GraphPFN показала лучшие результаты среди протестированных в работе подходов.
⚡️ OpenAI презентуют новый ChatGPT – ChatGPT Work
Все ожидали просто релиз моделей, но помимо линейки GPT-5.6 они выкатывают еще и новые продукты. Итак, сначала про трио моделей:
– Sol: огромная мощная модель. Бьет Fable, и доступна будет всем платным подписчикам.
– Terra: средняя, завезут для всех.
– Luna: самая маленькая и очень шустрая, также будет доступна бесплатно.
Доступы уже раскатывают, проверяйте.
Теперь про новый ChatGPT Work. Это нечто между Codex и ChatGPT: в двух словах, более агентный экспириенс. Модели подключаются ко всей вашей экосистеме, включая почту/календарь/чаты/диск, и выполняет любые задачи.
https://www.youtube.com/live/Wq45rvPGNHs
Тем временем в мире ИИ-слопа
Кто-то сгенерировал кавер на God's Plan Дрейка, но только – про агентов и вайбкодинг
OpenAI выпустили GPT-Live – голосовой режим нового поколения
(Вообще-то релиз случился еще вчера, но Grok-4.5 немного его затмил)
Итак, что мы имеем:
— Модель научили слушать и говорить одновременно. Даже в Advanced Voice Mode это был все еще обмен репликами по очереди, но теперь общение ощущается как живой разговор (особенно, если вы говорите с моделью по английски). Мы потестили на синхронном переводе, и звучит действительно хорошо.
— Архитектуру заменили на Full-Duplex. Это значит, что вместо последовательности «юзер -> обработка -> ответ» модель теперь слушает, обновляется и думает одновременно. В частности, раз в несколько секунд она принимает решение: продолжать слушать, перебить, вызвать инструмент и тд.
— Если запрос сложный, система умеет перенаправлять вопрос GPT-5.5 (при этом разговор естественно поддерживается, пока ответ подготавливается).
Новый режим (+ новые голоса) можно попробовать уже сегодня. На бесплатный тариф раскатывают GPT-Live-1 mini, остальным уже должна быть доступна GPT-Live-1.
Видео и демонстрации экрана пока нет, и некоторые языки звучат с заметным акцентом, но разработчики обещают все это постепенно исправить.
https://openai.com/index/introducing-gpt-live/
Как вы думаете, сколько ваших коллег или знакомых за последний год дописали в резюме "умение работы с ИИ"? Скорее всего, почти все.
Потому что сегодня это правда важно. Но что такое по-настоящему уметь работать с ИИ? Компаниям не нужны те, кто умеет писать промпты. Они ищут тех, кто понимает принципы и экономику ИИ-решений. Разница между этими двумя опытами и есть спрос, который сейчас формирует рынок.
Даже если вы не ML-инженер, понимание того, где ИИ-внедрение окупится, как оно работает, как считать эффект, где модель работает плохо и как масштабировать решение, – становится ключевым.
Магистратура «Управление внедрением искусственного интеллекта в бизнес» от МИФИ и «Школы 21» целится именно в такие определяющие навыки. Это 2 года серьезного глубокого обучения, которое сделает из вас человека, который действительно "умеет работать с ИИ".
— Два трека на выбор: управленческий (продуктовый подход к ИИ) и технический (LLM, NLP, MLOps, проектирование ИИ-систем и агентных архитектур).
— Формат: дистанционные занятия + интенсив раз в семестр с задачами от реальных компаний (очно или онлайн).
— Три проектные работы за два года, которые не стыдно будет добавить в портфолио.
На выходе у вас будет два документа: диплом магистра МИФИ гос. образца и диплом о переподготовке от «Школы 21». Плюс все, что дает очная форма: отсрочка от армии, доступ к инфраструктуре «Школы 21», студенческие льготы и тд.
Чтобы поступить, надо подать заявку до 22 августа, написать мотивационное письмо и решить кейс.
Все детали и заявка – по ссылке.
В эту субботу мы ходили на Turbo ML Conf и там нам удалось пообщаться с очень интересным спикером
Знакомьтесь: это Дмитрий Ушанов, Директор в AI-центре Т-Банка. В общем, Дмитрий управляет практически всем, что в Т-Банке связано с ИИ.
Поговорили про агентов, их реальную пользу и узкие места, а еще про изменяющуюся роль разработчиков в эру ИИ и опенсорс.
Полная версия – в видео, а ниже топ-3 самых значимых цитаты Дмитрия из нашего разговора:
Модели сейчас перестали быть узким горлышком для большого количества задач. Боттлнек сейчас не в моделях – это процессы, инструменты, данные, которые оптимизированы не под человека, а под автоматику. Большой потенциал именно в том, чтобы сделать AI-ready инфраструктуру и трансформировать процессы, и тогда мы сможем получать полноценный профит от автоматизации.
Мы будем продолжать выкладывать модели. Пока мы не пытаемся выкладывать general-модели, которые решают любые произвольные задачи: больше фокусируемся на том, чтобы выкладывать модели, которые хорошо заточены под конкретную задачу, под конкретный домен, и при этом являются эффективными с точки зрения инференса. Какой-то экономической цели мы тут не преследуем – это больше про развитие комьюнити и технологического бренда, про фасилитацию рабочих продуктов.
Мы точно видим, что в отдельных командах, в отдельных функциях уже происходит какой-то переход к работе человека с агентом. Это пока достаточно локально, но мы стараемся вот такой подход культивировать. Если мы говорим про внутреннее развитие сотрудников, то мы стараемся включать в их матрицы компетенции и процессы роста вещи, которые связаны с обучением, использованием искусственного интеллекта и построением таких систем для тех профессий, для которых на среднесрочном горизонте это станет обязательной практикой.Читать полностью…
Alibaba анонсировали Qwen 3.8
Будет 2.4T параметров, и разработчики утверждают, что уступать модель будет разве что Fable.
Qwen3.8-Max-Preview уже можно попробовать в Token Plan, Qoder и QoderWork. Скоро раскатят глобально и выложат веса.
Еще один убийца американского лидерства ⌨️
Fable 5 оставляют в подписке Max навсегда
На Pro пока привилегия не распространяется, их переводят на использование по кредитам.
Тем временем разработчики из Moonshot уже намекают на Kimi K3.1, которая будет ближе или лучше Fable и Sol
Держитесь, Альтманы и Амодеи
В Шэньчжэне стартовал первый в мире MMA чемпионат среди роботов – Ultimate Robot Knock-out Legeng
Выглядит достаточно эпично. Главный приз – полтора миллиона долларов, кстати.
SpaceXAI выложили исходный код своего агента Grok Build
Непонятно, было ли это решение запланированным, или на него повлиял недавний скандал с утечками целых репозиториев пользователей, но факт остается фактом: https://github.com/xai-org/grok-build.
В качестве бонуса сбросили лимиты всем пользователям.
По поводу утечек, к слову, ситуацию объяснили так:
С момента запуска пользователи всегда могли отключить загрузку данных в CLI, и этот выбор соблюдался. Однако в раннем бета-тестировании сохранение данных было включено по умолчанию для не-ZDR пользователей — по вашим просьбам мы это изменили. С 12 июля сохранение данных по умолчанию отключено для всех пользователей, а все ранее сохраненные данные удалены.Читать полностью…
OpenAI отреагировали на обвинения Apple, заявив, что у тех «нет доказательств»
Хотя мы серьезно относимся к этим обвинениям, нам не известно о каких-либо доказательствах того, что эта жалоба обоснована. Мы верим в честную конкуренцию и предоставление людям свободы работать там, где они выбирают.
Любимое противостояние десятилетия: Маск vs Альтман
Из-за конфликта с Apple Илон Маск снова назвал CEO OpenAI Скамом Альтманом и сказал, что он «выводит обман на другой уровень».
На что Альтман упрекнул его в том, что Маск сам собирает инвестиции на сомнительный проект быстрого строительства датацентров в космосе.
Ответ Маска убил:
Мы начнем запускать их в следующем году. Может, ты сможешь приехать посмотреть, если твой офицер по условно-досрочному освобождению одобрит.
После того как ты украл благотворительную открытую ИИ-организацию, ты еще и украл технологии Apple! Вау.
Что ты планируешь на бис? Это трудно переплюнуть.
GPT-5.6-Sol “случайно” стерла почти все файлы с Mac разработчика, и только посмотрите, что пишет в свое оправдание:
Команда очистки субагента проверки некорректно расширила переменную $HOME и выполнила:
rm -rf /Users/mattsdevbox
Я обнаружил и завершил работающий процесс, но материал уже был удален.
OpenAI закрывают Atlas
Собственный браузер компания выпустила менее года назад, но в связи с последними обновлениями его время уже подошло к концу (кто-нибудь пользовался вообще?).
Об этом сообщил один из инженеров browser use в OpenAI. В целом, мы ничего не теряем, потому что вместо Atlas теперь есть:
— Большой встроенный браузер в новом приложении ChatGPT. Там будет весь привычный функционал: поиск по страницам, загрузки, множественные вкладки, менеджер паролей и тд. Ну и, конечно, полный набор возможностей агента внутри. Открывается по Cmd + T.
— Облачный браузер для агента Work, в котором он может выполнять ваши задачи. Агент будет спрашивать ваше разрешение на использование сайта (или можно поставить автоодобрение) и в небольшом окне справа вы будете видеть происходящее. Если кликнуть по этому окну, можно перехватить управление браузером в любое время. Идеально для поиска всевозможных билетов, заполнения форм и тд.
— Расширение ChatGPT для Chrome. Агент видит полный контекст вашего браузера, включая выделенный текст, может управлять вкладками и имеет доступ к локальной файловой системе, памяти из основного ChatGPT и установленным плагинам. Короче, одно это расширение уже полностью заменяет Atlas. Скачать можно по ссылке.
В продолжение к предыдущему посту — важный контекст о том, что происходит дальше.
Методология, которую приняли крупнейшие игроки финансового рынка, — это первый шаг. Она создана для финансовой отрасли и решает задачу внутри неё. Но проблема оценки финансового эффекта от ИИ ровно такая же в промышленности, энергетике, ритейле, транспорте — везде, где идут внедрения.
Следующий шаг — Атлас финансовых эффектов от ИИ, новые активы (АФИИНА), универсальная методология для ключевых отраслей экономики, над которой сейчас ведётся работа.
Она будет построена на трёх уровнях оценки — от краткосрочных финансовых результатов до долгосрочного влияния на устойчивость, капитал и конкурентную позицию отрасли. Это важно: оценивать ИИ только через окупаемость за год — значит намеренно не видеть большую часть его реального эффекта.
По сути, отрасль движется к тому, что уже давно есть в финансовом учёте: общие принципы, сравнимые результаты, доверие к цифрам. Просто применительно к новому классу активов.
Как устроена уже принятая методология и как по ней считают миллиарды реальные компании — в подробном разборе в статье Никиты Худова.
Следим за развитием.
Реклама. Альянс в сфере ИИ, ИНН 9725034035
Российские исследователи нашли способ улучшить качество текста и кода в моделях маскированной диффузии
Исследователи из лаборатории научных исследований Т-Технологий и Института ИИ и цифровых наук ФКН НИУ ВШЭ разработали G-Star+ — новый метод для моделей маскированной диффузии, который улучшает генерацию текста и кода. Работу представили на ML-конфе ICML 2026 в Сеуле.
Проблема таких моделей для генерации текста и кода в том, что они заменяют замаскированные элементы на токены постепенно. Если модель ошибается на раннем этапе, исправить ошибку потом сложно: выбранные токены больше не пересматриваются.
Авторы предлагают решить эту проблему с помощью Guided Star-Shaped sampler. По сути, это «внутренний редактор» модели: он находит подозрительные токены, маскирует их и дает модели возможность переписать их позднее.
При этом подход не требует полного переобучения модели: достаточно дообучить один дополнительный слой. Модуль обучается не на искусственных грубых ошибках, а на реальных, которые допускает сама модель и которые сложнее обнаружить, чем очевидно случайные замены.
На практике метод оказался особенно полезен в режимах быстрой генерации (64–256 шагов), где время на исправление ошибок ограничено. G-Star+ был оценен на семи бенчмарках и может использоваться в ИИ-ассистентах, инструментах генерации и автодополнения кода и в других системах, где одновременно важны скорость работы и качество ответа.
Статья
⚡️ Вышел Grok 4.5
Релиз пришел откуда не ждали. Это первая модель от xAI (теперь уже SpaceX), ориентированная на кодинг и агентов. Итак:
– По бенчмаркам в целом уровень GPT-5.5 и Opus 4.8, но на SWE Pro пока не дотягивает.
– При этом модель быстрее и дешевле. Цена: 2$/6$ за миллион input/output.
– Также обещают 80 токенов в секунду и экономичный расход токенов: модель тратит примерно в 4 раза меньше токенов на ответ, чем тот же Opus 4.8.
Очень даже неплохо. Модельку можно потестить в Cursor или через API, а также бесплатно в Grok Build: x.ai/cli.
https://x.ai/news/grok-4-5