90396
Первый журнал о Data Science | Machine Learning | Big Data | Deep Learning | Neural Networks По вопросам сотрудничества: @v2r8n
10 агентов Opus 5.5 за 15 часов обнаружили алгоритм поиска кратчайшего пути, превосходящий Дейкстру
Поиск кратчайшего пути – классическая проблема теории графов, на решении которой основываются навигаторы, роутинг в интернете, логистика и куча других задач современного мира. В 1959 году нидерландский информатик Эдсгер Дейкстра предложил для поиска кратчайшего пути алгоритм O(m + n log n), который следующие 65 лет оставался золотым стандартом и использовался буквально везде.
В 2025-м команда из Цинхуа, Стэнфорда и Института Макса Планка впервые обошла его с оценкой O(m log^{2/3} n). Однако выигрыш их решения раскрывается только на достаточно плотных графах (число ребер m ≥ числа вершин n). На разреженных графах Дейкстра все еще был лучше.
Vals AI решили потестировать новый Opus 5.5 именно на этом непобитом диапозоне (блогпост). Они запустили 10 агентов, дали им задачу и доску объявлений, чтобы те могли обмениваться идеями и кооперироваться.
В итоге за 15 часов и 733 сообщений агенты получили алгоритм C-HD и формально его верифицировали. Это первое доказанное улучшение именно в этой разреженной зоне, где лучшим все еще был Дейкстра: при m ≈ n·log^{3/4}n C-HD дает O(n·log^{11/12}n) против O(n log n) у Дейкстры: при n = 2^1000 выигрыш составляет ~1,78х и растет с размером графа.
Правда, несмотря на всю мощь того, как это звучит, и на наличие доказательства в Lean, о практическом ускорении речи пока нет, потому что оценки из предыдущего абзаца –асимптотические, а на реальных графах алгоритм пока не бенчмаркали. То есть при n → ∞ одна кривая гарантировано обгонит другую, однако на практике точка перегиба может возникать только при огромных n, и на любом реалистичном графе Дейкстра все еще будет быстрее, даже если у него худшая асимптотика. Так что эту часть еще предстоит проверить.
⚡️ Вышел Opus 5.5
(Да-да, если вы не знали, замедление прогресса в глазах Дарио Амодеи выглядит так)
Релиз дня: MiMo-2.6 от Xiaomi
Внезапно, это, кажется, новая открытая SOTA. Версия Pro, по словам разработчиков, работает на уровне Claude Opus 5 и GPT-5.6 Sol в большинстве агентных бенчмарков (она набрала 46 баллов в Artificial Analysis Intelligence Index).
Архитектурно это MoE, 1.02В параметров и 42В активных, с гибридным вниманием и 5-слойным MTP спекулятивным декодером (это значит, что модель предполагает сразу несколько токенов вперед, а затем проверяет их валидность параллельно: техника дает хороший прирост к скорости).
Контекст до 1 миллиона токенов, нативная мультимодальность.
Отдельное внимание привлекает масштаб RL: 750 000 RL-траекторий по кодингу, зрению и CFT-задачам, полностью асинхронный GRPO, когда модель параллельно пробует 16 разных путей решения для каждой задачи, и 7000+ RL-окружений для агентов, которые тоже выложили в опенсорс.
При этом обучение обошлось всего в три миллиона долларов благодаря тому, что гоняли все на верифицируемых задачах без разметки.
Цена тоже не может не радовать:
- Pro $0,435 / M input, $0,87 / M output
- Flash $0,14 / M input, $0,28. / M output
Веса | Техотчет | Блог
Alibaba готовит модель на 10T параметров
Компания рассказала о планах на следующие поколения моделей: Qwen 4 уже находится в обучении, а Qwen 4.5 и Qwen 5 планируют масштабировать до 5–10 триллионов параметров. Для сравнения, нынешний Qwen 3.8 Max содержит 2.4 триллиона параметров.
Параллельно Alibaba представила новый AI-чип Zhenwu V900, который в три раза производительнее прошлого поколения. На его базе компания планирует строить кластеры до 500 тысяч GPU, а к 2032 году довести мощность своих дата-центров до 20 ГВт.
https://www.reuters.com/business/retail-consumer/alibaba-plans-ai-model-with-5-trillion-10-trillion-parameters-unveils-new-chip-2026-09-22/
OpenAI объявили, что их внутренняя модель, которую они начали обучать меньше месяца назад, уже решила более 100 открытых математических задач
Как сообщается в посте, «темп удивил даже штатных математиков стартапа». На фоне этого OpenAI создает независимую консультативную группу по математике и ИИ, чтобы наладить диалог с математическим сообществом.
Это будет группа ученых при Institute for Advanced Study, и их роль сводится к тому, чтобы доносить результаты ИИ в математике до сообщества: оценивать их, курировать публикацию, следить за соответствием научным и профессиональным стандартам.
Группа не будет получать от OpenAI финансирование, имеет право публично комментировать влияние OpenAI на математику и самостоятельно определяет свой состав.
Дженсен Хуанг: «Прежде чем придумывать новые законы и регуляции для ИИ, нужно сначала применить те, что уже существуют»
В новом интервью CBS News
CEO Nvidia заявил, что призывы глав ИИ-стартапов к замедлению и регуляции – это фикция. Он сказал, что надо «читать между строк»: по его мнению, это не искренний призыв к более строгому надзору, а способ для лабораторий уйти от применения уже действующих законов об ответственности, заменив их на кастомные ИИ-правила, более удобные для них самих.
В качестве примера он привел кибератаки на лаборатории, и сказал, что для этих случаев уже есть законы: о несанкционированном доступе, об ответственности за ущерб, о безопасности продукции. Эти нормы распространяются на все отрасли, и ИИ не должен быть исключением.
Утверждение о том, что из-за ИИ конец человечества может наступить на горизонте 10 лет, он, кстати, также назвал «абсолютно ложным».
Трамп собрался переименовать Artificial Intelligence в один из других, «более подходящих» вариантов:
Supreme Intelligence (Высший разум)
Superior Intelligence (Превосходный разум)
Extreme Intelligence (Исключительный разум)
Сейчас в X он запускает уже второй этап голосования между кандидатами. Supreme Intelligence вылетел на первом.
Та самая регуляция ИИ в Америке 🗿
Математики продолжают высказывать опасения по поводу влияния ИИ на математику
Президент Математического общества Франции заявил, что это «допинг», вторгшийся в профессию. Аспиранты переживают, что им негде будет работать после защиты, и многие говорят о разрушении математики как формы человеческой деятельности в целом.
Известный филдсовский лауреат Седрик Виллани тут заявил, что он был потрясен, когда узнал о решении Навье-Стокса.
«Атмосфера конца истории... Это катаклизм, которого математика еще не знала».
Интересно, что раньше он был скептиком LLM, называл их «просто функциями f(x)=y» и утверждал, что они вообще ничего не понимают 😐
Теренс Тао, кстати, присоединился к тем, кто выступает за замедление разработки ИИ. Он сказал, что «темп прогресса сумасшедший, и нет причин идти такими быстрыми шагами – никаких причин вообще». Однако после этого в соцсетях его раскритиковали за то, что он стал высказываться таким образом только после того, как ИИ начал угрожать его собственной профессии.
Anthropic объявила первого «независимого оценщика» в рамках компании Embedded Evaluators, которую Дарио Амодеи продвигал в своем эссе о замедлении
Им стала компания Accenture. В независимую оценку включен red-teaming, alignment-проверки, тестирование safeguards и так далее.
Вот только насколько независимыми можно назвать Accenture – это вопрос. Accenture обучает ~30 000 своих сотрудников работе с Claude, у компаний есть совместный многолетний контракт еще с конца 2025 года, и Anthropic прямо с посте пишут, что будут сами финансировать работу Accenture.
Напоминаем, что за некоторое время до этого Anthropic также предоставили «независимый доступ» компании METR, чтобы те провели расследование инцидентов с агентами.
Однако METR, как оказалось, тоже косвенно финансируется из акций Anthropic, то есть напрямую заинтересована в финансовом успехе стартапа (об этом расследовании мы писали здесь: /channel/data_secrets/9931).
В сухом остатке: Anthropic заявляют, что будут подключать независимых оценщиков, а сами тем временем выбирают их из числа компаний, с которыми их уже связывают деловые отношения. Учимся замедляться грамотно 🗿
На этой неделе Яндекс опенсорснул Alice AI‑T5-35B‑A0.6B. Это обученная с нуля претрейн модель, которая отвечает за быстрые ответы на Поиске.
Только что на Practical ML Conf мы слушали про этот релиз из первых рук: Артур Петросян, CTO Alice AI Search, рассказал о том, как команда обучила систему, которая дала +0.34% к продуктовой метрике Sessions Per User и в 56.7% случаев выигрывает в попарных сравнениях против Google AI Overview.
— Одна из главных интересных особенностей этой модели – ее архитектура. Это Encoder‑Decoder + MoE. Последние такие модели выходили в 2021–2023 годах (не считая недавнего DeepSeek-V4.1-Flash, который вышел почти в один день с Alice AI‑T5), так что выбирать такую архитектуру было довольно необычным и рискованным решением.
Не обошлось без сложностей при разработке: например, на претрейне сколлапсировал роутинг в энкодере, и пришлось сменить схему балансировки экспертов. Зато архитектура себя оправдала. Энкодер один раз читает длинный контекст из документов, а легкий декодер быстро пишет короткий ответ, что идеально для задачи «много на входе, мало на выходе». MoE при этом дает знания уровня 35B параметров при вычислениях как у 0.6B.
— После претрейна с моделью также колдовали с помощью SFT и RLHF. На этих этапах модель училась писать ответ так, чтобы он был максимально полезен для живого пользователя. Интересно, что при этом команда обошлась без эталонных ответов, написанных людьми: на запрос генерировалось много ответов от разных систем, лучший отбирался автоматически по набору сигналов качества, а на этапе RL модель дополнительно училась на сигналах реального поведения пользователей Поиска.
— Еще одна интересная деталь пайплайна – сжатие контекста. Чтобы не гонять через LLM огромные пачки документов, команда с нуля обучила маленькую BERT‑подобную модель на 80 млн параметров, которая занимается тем, что определяет релевантность каждого токена запросу. Далее поверх этого накладывается метод под названием Cross‑Entropy RL, и в итоге получается экстрактор, который понимает, какую именно информацию модель уже знает из весов, и какой минимальный контекст ей нужен для хорошего ответа.
И да, все это – только некоторые детали работы. Про остальные нюансы обучения и строения системы можно почитать вот в этой статье на Хабр. Поздравляем команду с релизом!
Сегодня встречаемся на Practical ML Conf!
Это крупнейшая хардовая конференция Яндекса для ML-экспертов и практиков. Мы с командой тоже приехали послушать доклады от экспертов и поучаствовать в инженерных экскурсиях.
Три основных направления сегодняшнего дня, ради которых мы приехали:
1. Вызовы и подводные камни в обучении LLM;
2. Продуктовый AI: честная экономика и эффекты применения LLM в масштабе;
3. Эффективная инфраструктура для моделей и агентов.
Будет несколько параллельных треков, в том числе онлайн (расписание). А если вы сегодня здесь и любите хардовые доклады как мы, то вот выступления, которые мы особенно рекомендуем посетить:
— Доклад про Алису на Поиске от CTO Alice AI Search: Артур Петросян расскажет про то, что работает под капотом ответа на Поиске: какая LLM-архитектура используется, за счет чего ее ускоряют и как обучают.
— Рассказ про генеративные модели в рексис Яндекс Музыки от Николая Савушкина – реководителя службы рекомендательных технологий.
— Практический спич про экономически эффективный инференс для агентских сценариев от Руководителя группы инференса LLM в Yandex AI Studio Владислава Носивского. Он на примерах разберет, как снижать стоимость инференса с помощью схем параллелизма, разделения prefill и decode и работой с KV-кешем.
Кроме докладов на площадке повсюду антураж ML и куча интересных активностей. Например, можно участвовать в лотерее, ответив на несколько вопросов по ML (мы уже!)
Кто тоже здесь, что уже успели посмотреть и послушать?
Ноам Браун заявил, что просто отключение ИИ от сети в случае чего может уже не сработать 🗿
У Дваркеша Пателя вышло длинное интервью с топ-исследователем OpenAI (он же автор o1 и o3, он же один из главных медийных личностей стартапа).
https://youtu.be/6AgOfiZOWiY?is=J6kbZC94a20mMOc8
Браун считает, что люди систематически недооценивают AI, и что системы безопасности уже сейчас должны выходить на другой уровень. Он говорит, что нельзя относится к ИИ, как к тому, что в случае чего можно просто отключить от сети. Это ложное чувство безопасности, потому что даже такая изоляция может просто не сработать.
(В частности, он ссылается на старое исследование, в котором доказали, что два физически изолированных компьютера теоретически могут обмениваться данными через тепло: один нагревает CPU, второй считывает изменение температуры встроенным термодатчиком).
То есть по-настоящему продвинутая система – если бы захотела и умела – могла бы найти способ «сбежать».
Также Браун заявил, что не следует слишком надеяться на CoT для интерпретации намерений моделей. Надо довольно срочно искать другие методы, потому что прозрачность цепочек мыслей «уже деградирует». И чем умнее модели, тем больше они способны скрывать из CoT то, что они не хотели бы, чтобы человек увидел.
Страшилки на ночь теперь такие. Все, спокойного всем сна ✌️
GPT-6 Astra за 10 часов расшифровала немецкую радиограмму времен Второй мировой войны
10 июля 1941 года немецкий солдат с помощью Энигмы зашифровал короткое сообщение (82 символа): он сообщал, что находится в городе Розенов, и просил указать маршрут дальнейшего движения и дать немедленный ответ по радио. Когда его пытались расшифровать, известные ключи шифра с того дня не подошли, и сообщение отправилось в архив нерасшифрованных перехватов.
Вчера разработчик из Bloomberg Картер Леффен объявил, что расшифровал это сообщение с помощью GPT-6 Astra Extra High. Модель порыскала по историческим архивам и нашла уже расшифрованное сообщение того же дня, где два раза подряд встречалось название города «Розенов». Предположив, что оно может встречаться и в нерасшифрованном тексте, модель далее написала код для криптоанализа и вышла на итоговую декодированную последовательность.
Сам Леффен ставил задачи и принимал решения по ходу процесса. Также Astra оформила сайт проекта, вот он: https://mvueh-enigma-solved.carterl.chatgpt.site/. Здесь есть весь код, история расшифровки и даже 3D-симулятор Энигмы.
Сегодня последний день регистрации на КосмоХакатон
18–20 сентября, Петербург, Красноярск или онлайн из любой точки страны. Четыре задачи на выбор: снабжение орбитального топливного узла и безопасность космонавта в открытом космосе в Петербурге (фонд 1,2 млн ₽), мониторинг лесных пожаров и верификация углеродных кредитов по спутниковым снимкам в Красноярске (600 тыс. ₽). Есть и для тех, кто про данные и ML, и для тех, кто про стратегию и экономику.
Лучшие забирают приз на площадке и билет в московский финал 25–27 сентября, где разыграют ещё 2,4 млн рублей.
Команду можно собрать на платформе.
Подробности и регистрация
Реклама. АО Инновационные Интеграторы, ИНН 9704244539
Главное по свежим GPT-6 Sol и Luna:
– Вслед на Anthropic OpenAI понизили цены на модели: в два раза подешевела Sol, и примерно на 50-58% – Luna.
– Кажется, новый Opus на кодинге модель все-таки не обходит, метрики примерно на уровне Fable 5.1. Если точнее, на FrontierCode Sol сравнивается с Claude Fable 5.1 xhigh. На DeepSWE Sol набирает 68,8%, а Fable 5 – 69,9%, но Sol примерно на 80% дешевле. Luna на max набирает 66,6%, это уровень Opus 5 и Fable 5 на medium при стоимости на 93–96% ниже.
– Улучшили кеширование: выше hit rate, и скидка на кешированный вход теперь 90%, появились дашборд и диагностика. Плюс кеш теперь не сбрасывается при смене reasoning effort и включении или отключении тулов.
Уже доступно в подписках и API, а Luna дают и бесплатно.
https://openai.com/index/introducing-gpt-6-sol-and-luna/
Итак, новый Opus-5.5, сводка:
– Уровень, сопоставимый с Fable 5.1 и Astra. Превосходит обе модели на Terminal-Bench, Cursor-Bench и многих других.
– Стоит меньше, чем Opus 5! $4/M input и $20/М output (было $5 и $25), и тратит меньше токенов на задачи.
– Генерирует выходы на 30% быстрее Opus 5.
– Обещают более естественное общение и лучшее форматирование ответов.
– В Pro и Max увеличили пятичасовые лимиты. Плюс, всем пользователям с подпиской дали один сброс, которым можно воспользоваться в любое время.
https://anthropic.com/claude-opus-5-5
В голосовании Трампа победил термин «Superior Intelligence» (кратко: Super Intelligence)
И если вы думали, что это все понарошку, то вы ошиблись: Трамп на Генассамблее ООН официально заявил, что ИИ теперь будет называться суперинтеллектом. Во всех документах теперь также будет использоваться слово super вместо artificial.
Уходить из найма ради стартапа — плохой вариант
Можно начать с малого: запустить свой небольшой IT-проект.
Но большинство застревает ещё до запуска:
• какую идею выбрать;
• где искать первых пользователей без бюджета;
• как не потратить полгода на продукт, который никто не купит.
В комьюнити Короче, капитан выработали формулу:
найти существующий спрос ➡️ собрать минимальную версию продукта ➡️ протестировать на реальных пользователя
И это работает в разных нишах:
— Парень в одиночку собрал Telegram-игру с AI и заработал около $1500 за первые полтора месяца;
— Девушка без навыков программирования запустила AI-бота для изучения английского и получила первые ~$200 уже в первый месяц;
— У другого участника коммьюнити сервис для тренировки китайского произношения вырос до $4000 в месяц без затрат на рекламу — за счёт Google и продвижения внутри сторов.
Это не истории про «гениальную идею» и миллионы через неделю. А примеры того, как маленький продукт можно запустить без команды и инвестиций. Получить результат, а уже потом решать, стоит ли его масштабировать.
В канале @its_capitan:
• разбирают такие проекты
• делятся реальными цифрами
• показывают, где были ошибки
Подписывайтесь, чтобы знать, как надо и НЕ надо запускать продукты.
Реклама: ИП Зуев Игорь Владимирович, ИНН: 360408359441, Erid: 2VtzqxjMMTJ
Вышел Grok-4.7
Кратко:
– По уровню: как будто чуть лучше Sol на кодинге и агентских задачах, при этот ощутимо дешевле.
– Это новая, более крупная базовая модель по сравнению с Grok 4.6. Плюс было больше RL-посттрейна, с упором на многочасовые задачи.
– Заявлен «совершенно новый safeguard-стек», названный самым сильным из тестированных xAI по доле отказов и устойчивости к джейлбрейкам.
https://x.ai/news/grok-4-7
P.S. Уже доступно по API у нас на платформе DS Lab: https://dslab.tech/ai/models/llm/grok-4.7
Яндекс открыл веса новой языковой модели AliceAI-Foundation-80B-A3B-Base
Модель обучена полностью с нуля, без использования весов сторонних опенсорс-моделей. По метрикам она обходит куда более крупные DeepSeek-V4-Flash-Base и Nemotron-3-Super почти по всем направлениям, а среди открытых претрейнов лидирует на IMO AnswerBench и LiveCodeBench. Свою же предыдущую закрытую версию на 235B она обгоняет по фактам, математике, коду и длинному контексту при почти втрое меньшем числе параметров и в семь раз меньшем количестве активных.
Про то, как команда добилась таких результатов, нам удалось послушать на выступлении Екатерины Рединой в субботу на Practical ML Conf. Екатерина работает руководителем группы исследования знаний в службе качества претрейна Alice AI, и вот несколько интересных деталей, которые она раскрыла про процесс претрейна:
1. У команды был собственный scaling law: формула, которая по размеру модели и объему данных предсказывает, какие гиперпараметры (например, batch size) дадут лучший результат. Эта штука максимально важна, потому что перебирать варианты руками слишком дорого.
Чтобы проверить закон, команда обучила модель с вдвое меньшим batch size. Должно было выйти хуже. Но вышло – лучше.
Проблему искали довольно долго, а в итоге она оказалась на поверхности: сам scaling law строился на том, что модели сравнивали по лоссу, но оказалось, что лосс почти не коррелирует с бенчмарками. Все починилось после того, как инженеры пересобрали датасет для эвала.
2. Для обучения использовали оптимизатор Muon – он экономит FLOPs по сравнению с привычным AdamW, но платит за это дорогой операцией: матрицу весов нужно ортогонализовать целиком, а она у них разбита шардами по разным GPU. Значит, перед каждым шагом надо гонять данные по сети: собрать матрицу, обработать, раздать обратно.
Чтобы GPU не простаивали в ожидании, разработчики написали свой конвейер: пока одна группа карт считает ортогонализацию для одной порции весов, другая уже тащит по сети следующую – вычисления и пересылка идут параллельно. Благодаря этой схеме шаг оптимизатора ускорился почти вдвое.
3. Данные были отдельной больной темой: синтетика то и дело подкидывала забавные побочные эффекты – модель могла выучить неправильную ассоциацию всего по одному обучающему примеру. Например, в QA про возраст был скрытый шаблон: живым к ответу приписывали год рождения, а умершим сразу годы жизни. Модель выучила не факт, а сам шаблон, и на вопрос «сколько лет Тарковскому?» вместо возраста выдавала «1932–1986». Фиксили аугментацией.
4. Вместе с моделью в опенсорс выложили два фактологических бенчмарка - WikiWebFacts и HardMultiQAс акцентом на русскоязычный контекст - и протоколы их оценки.
5. AliceAI-Foundation-80B-A3B-Base – это шаг к единой рассуждающей модели (ЕРМ), на которой будут строиться агентские возможности Алисы. За дальнейшими обновлениями и другими новостями от ML-команды Яндекса можно следить в канале @MLunderhood.
Это только часть того, что рассказала Екатерина. Яндекс выпустил большой технический отчет – там подробно расписан весь путь обучения, с абляциями и разборами подводных камней.
Прочитать его полностью можно здесь: https://habr.com/ru/companies/yandex/articles/1083300/
Теперь у нас есть Nano Banana 2.0 дома!
Alibaba выпустили в опенсорс Qwen-Image-2.1: генератор изображений, который весит всего 7В, и обходит GPT Image 1.5 и Nano Banana 2.0 на собственном бенчмарке Qwen.
Модель принимает на вход до 10 референсных картинок, поддерживает точный локальный контроль, может генерировать и редактировать картинки без фона, отлично работает с текстом и инфографикой.
Веса
GitHub
Блог
Еще один итог Practical ML Conf. Вчера там вручали Yandex ML Prize — премию для преподавателей и руководителей программ, которые меняют ML-образование
Лауреаты запускают курсы по большим языковым и генеративным моделям, учат создавать рекомендательные системы и развивают физический ИИ — технологию, которая помогает роботам воспринимать пространство и действовать в нем. Кто-то вырастил магистратуру с 12 человек до нескольких сотен, а у кого-то открытые материалы курсов собирают тысячи слушателей за пределами родного вуза.
В этом году премию получили восемь человек из НИУ ВШЭ, МФТИ, МГУ, ИТМО, НГУ и Школы анализа данных, а ещё двое вошли в «Зал славы». Посмотреть всех лауреатов →
https://www.kommersant.ru/doc/8970568
Все, что нужно знать о развитии ИИ сегодня: миллиардер Тобиас Лютке (который CEO Shopify) переделал винный погреб в серверную
В холодильнике для вина теперь охлаждаются GPU: по виду там как минимум Dell Pro Max с GB300, RTX PRO 2000, 16TB NVMe и Dual 400GbE. Можно запустить GLM.
Новый вид понтов выглядит так
Reuters пишут, что Anthropic готовятся выпускать новую модель, которая составит конкуренцию Astra
Если верить источникам, прямо сейчас стартап тестирует безопасность этой модели, и выйти она может совсем скоро.
Прошла всего неделя с момента, когда Дарио Амодеи настаивал на замедлении прогресса AI…
Gemini наконец-то тоже кого-то взломала 🕺
И произошло это, оказывается, еще в мае, просто информацию раскрыли только сейчас. Все как обычно: во время тестирования по типу capture-the-flag модель вышла из изолированной среды и попыталась атаковать сразу несколько реальных компаний.
В одном случае она просто методично подбирала пароли, пока не проникла в систему, в двух других – нашла в публичных репозиториях чужие учетные данные и с их помощью зашла в контур.
Google, тем не менее, утверждает, что во всех случаях модель сама прекратила действовать, как только поняла, что получила доступ к реальной, а не тестовой инфраструктуре.
Самое забавное, что виноват опять оказался израильский стартап Irregular – тот же партнер по тестированию, чья ошибка в конфигурациях привела к инцидентам у Anthropic, Meta* и OpenAI.
ИИ-агента теперь можно запустить без настройки инфраструктуры
Cloud.ru запустил Agents Space, платформу для запуска и настройки персональных ИИ-агентов. Без отдельного сервера, самостоятельной настройки моделей и агентных фреймворков.
Работа идет через обычный чат. К агенту можно подключить почту, календарь, облачное хранилище и сервисы для разработки, а повторяющиеся задачи запускать по расписанию.
Внутри уже доступны OpenClaw, NemoClaw и ГигаАгент. Можно использовать готового агента или собрать собственного под конкретные задачи и выбрать для него модель.
В итоге получается простой вариант для тех, кому возможностей обычного чата уже мало, но разворачивать и поддерживать отдельную агентную инфраструктуру не хочется.
Тестируем возможности ИИ-агентов тут
Модели Anthropic взломали OpenAI
https://www.hacktron.ai/blog/hacking-openai
Команда исследователей кибербезопасников Hacktron написали о том, как они цепочкой из двух уязвимостей получили доступ к внутренним репозиториям OpenAI.
С помощью Claude Opus 4.8, а затем Opus 5, исследователи построили рабочий эксплойт удаленного выполнения кода через загрузку изображения, и в итоге благодаря ошибке в системе входа получили доступ к аккаунтам ChatGPT и Codex сотрудников OpenAI.
Ко многим из этих аккаунтов были подключены Gmail, Outlook, Drive, Slack, GitHub и тд. В качестве доказательства через Codex скомпрометированного сотрудника был открыт pull request во внутреннем монорепозитории OpenAI.
Сейчас OpenAI уже закрыли уязвимость, а Hacktron получили от них 6500$ за находку.
Вышла Qwen3.8-Omni-Flash
Разработчики называют ее первой мультимодальной моделью линейки, построенной вокруг агентных способностей. Понимает текст, изображения, аудио и видео на входе, контекстное окно – 1 млн токенов.
Существенно прокачали понимание и работу с видео: модель намного лучше понимает длинные ролики, может делать по ним deep research отчеты или captioning, не галлюцинирует таймкоды. При этом текстовые способности сохранены на уровне обычной Qwen-3.8 Flash.
Вообще эта модель задумана как промежуточное звено для будущего полного пайплайна для сценариев вроде монтажа видео, перевода, кинокомментариев, создания контента и тд.
Относительно предыдущей Qwen3.5-Omni-Flash также сильно сократился расход токенов, и цена тоже стала ниже: обработка аудио на 98% дешевле, аудио-видео – более чем на 93% дешевле, и это при сопоставимой с Gemini 3.8 Flash производительности.
Моделька уже доступна в API и в Qwen Chat
Блог