tsingular | Unsorted

Telegram-канал tsingular - Технозаметки Малышева

2604

Новости инноваций из мира искусственного интеллекта. 🤖 Всё об ИИ, ИТ трендах и технологической сингулярности. Бесплатный бот для подписчиков: @ai_gptfreebot автор: @mbmal канал личный. Поддержка: https://pay.cloudtips.ru/p/c8960bbb

Subscribe to a channel

Технозаметки Малышева

Счётчик AGI сдвинулся на 99%: гуманоид Figure впервые поработал в 30 незнакомых квартирах без единой минуты обучения там

Компания Figure выкатила Helix 2.5, - самую продвинутую свою нейросеть.
Управляемый ею робот зашёл в 30 незнакомых домов Калифорнии и сразу приступил к работе: ни минуты сбора данных, ни файнтюнинга в этих квартирах.
Счётчик AGI Алана Томпсона, всё лето стоявший на 98%, сдвинулся на 99%: Helix 2.5 закрыл Woz-тест в масштабе.

⚛️ За счёт чего получилось:
Helix 2.5 претренировали на Index, - датасете человеческого поведения, прирастающем на ~35 минут новых данных каждую секунду.
Из одной базовой модели сделали три поведения: уборка гостиной, складывание полотенец, заправка кровати.
Претрейн на Index сам по себе поднял zero-shot успех с 9% до 56% (строгая оценка: всё или ничего, зачёт только за полностью выполненную задачу).
Если сравнивать с Helix 02, то получается вдвое меньше данных, специфичных для конкретной задаче при генерализации, охватывающий в 30 раз более широкий диапазон.

🧠 Впервые измерен scaling law переноса человек-робот:
Каждое удвоение данных Index закономерно улучшало предсказание действий робота, - как в языковых моделях.
Точность такая, что лосс крупнейшего прогона предсказали до старта обучения: ошибка 0.54% на диапазоне 8x.
Figure: рецепт уже знаком по другим областям ИИ: широко учись на претрейне, задай поведение один раз, генерализуй на развёртывании.

На тренировку Helix влили $3.5 млрд вычислений.

💼 Зачем бизнесу:
Zero-shot успех в незнакомой обстановке закрывает парадигму «учим робота под каждое место отдельно» и позволяет быстро масштабироваться.
Самокоррекция всего тела по классам действий, - "отойти, сменить стойку, обойти препятствие", позволяет доводить длинные задачи до конца без человека.

Оставшийся 1% в AGI счётчике Алана, - тонкая моторика многошаговой сборки на уровне среднего человека.
Чуть чуть осталось. Может до Нового Года как раз.

#Helix #Figure #робототехника #AGI #ИИ
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен

Читать полностью…

Технозаметки Малышева

Забавный тренд.

Кидаете в GPT пустую коробочку с промптом, получаете разбор:

На основе всего, что ты обо мне знаешь, заполни обе стороны этого контейнера.
Сверху какой я для мира, снизу,- какой я внутри


Делитесь, что получилось :)

#промпты
------
@tsingular

Читать полностью…

Технозаметки Малышева

Multiverse Computing усилили обучение LLM с помощью квантового процессора: Quasar 1.1 438B тратит на 37.6% меньше токенов на каждый ответ

Европейская компания Multiverse Computing перевыпустила кодинг-агента Quasar: часть обучающих данных сгенерировал гибридный квантовый LLM на 156-кубитном IBM Heron в Сан-Себастьяне. Первый случай, когда квантовый компьютер поучаствовал в обучении модели.

⚛️ Квант в конвейере:
Взяли Qwen3-30B-A3B и заменили шестую часть слоёв квантовой нейросетью (QNN).
Генератор дополнил healing-набор: логи рассуждений, tool-call, знания. Квантовые исследования тут уже использовались ранее для разработки алгоритма отбора экспертов CompactifAI.

🧠 Сжатие плюс доводка:
В основе открытая GLM-5.2 от Z.ai.
CompactifAI оставляет 148 из 256 экспертов MoE на слой: компактнее и дешевле в использовании.
Healing-дообучение возвращает способности после сжатия и убирает дурные привычки исходника.
В сравнении с Quasar 1.0 получили прирост: HLE +6.2%, GPQA +4.3%, IFBench +4.6%.
При этом средняя длина ответа сжалась с 3322.9 до 2074.3 токенов: на каждый ответ уходит на 37.6% меньше токенов.
Агент делает десятки вызовов на задачу и сокращение длины ответа в совокупности с ростом метрик по качеству ответов даёт кратный рост общей эффективности.

🛡 Расцензуривание без переобучения:
В рамках переработки модели так же были удалены некоторые типы цензуры, которые мешали непредвзятой обработке политик безопасности.
При этом политические отказы упали с 71.18% до 41%, а вредоносный контент по-прежнему блокируется (93% на JailbreakBench).

Метод из статьи Refusal Steering: судья-LLM отличает отказ от уловок (подмена темы, нарратив), вектор уводит активации от «направления отказа».
Веса не трогаются, правка обратима.
Для аналитики главное: вместо одной одобренной версии - разбор по фактам из весов модели.

💼 Зачем бизнесу:
Меньше токенов на ответ: ниже счёт за сервинг, быстрее агент.
Комплаенс для Европы: вендор из ЕС, развёртывание по EU AI Act.
И для информации, что квантовые компьютеры уже частично участвуют в обучении моделей. Дальше, - больше.

#Quasar #Multiverse #кванты #ИИ
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен

Читать полностью…

Технозаметки Малышева

Доброе утро.
Всем хорошей недели :)

#юмор
------
@tsingular

Читать полностью…

Технозаметки Малышева

Надо отметить, что ML (без мух) с Гермесом, - достаточно увлекательное занятие само по себе.

решил поиграться в RSI и собрал агентский цикл на базе ModernBERT-large и MLFlow по обучению сверхмалой модели по примеру Jev обучению игры в тетрис и змейку и классификации текстов и картинок одновременно.

т.е. под одну задачу - нет проблем модель сделать - а вот чтобы она хорошо себя показывала во всех - отдельное приключение по намазыванию разных слоёв и увеличению размерности и архитектуры через постоянное дообучение.

Короче дипсик 4.1 флэш весь день с утра её гоняет. ещё дал ему в помощь локальную qwen3.8:27b - и со змейкой и тетрисом он уже справился.

модель при этом размером 1.7М. отвечает за 4мс на М5
это не просто быстро, а трындец как быстро :)
за 1 секунду она может сработать 250 раз :)

170млн токенов он сожрал за день, что по ценам выходного дня, - около $3

продолжаем тренировку.

в ИИзбранном покажу на звонке что и как :)

#обучение #BERT #тетрис #змейка
———
@tsingular

Читать полностью…

Технозаметки Малышева

За последние 2 недели у нас неожиданно много новеньких.

Не очень понимаю откуда, ведь телеграмм то не работает, - всем известно. Но раз уж такое дело, - напоминаю, что есть у меня ещё один канал, - ИИзбранное и мы на нем, уже регулярно, проводим онлайн эфиры обсуждая всякое полезное.

Там и лекции были и просто разбор задач (все, кстати, там в записи лежит, можно зайти и с самого начала учиться), много всяких разных полезных руководств там же лежит, ждут вас :)

Так вот сегодня мы планируем провести эфир на тему:

Методика ИИ-трансформации бизнеса.
- инструменты измерения, построение матрицы зрелости, и создание дорожной карты ИИ трансформации
Отдельно разберём, что может выступить источником финансирования ИИ трансформации и как сделать так чтобы процессы самофинансировались.
- обсудим ключевые мысли, которые помогут "зацепить" собственника.

Ссылка на этот эфир там же в ИИзбранном.

Вход тут:
/channel/tsingular/7560

Заходите, - пообщаемся

#эфиры #анонсы
———
@tsingular

Читать полностью…

Технозаметки Малышева

📌Goldman Sachs повысил прогноз по развитию физического ИИ

Финансовый конгломерат обновил свой прогноз по динамике развития воплощенного ИИ, предположив, что к 2035 году в мире будет выпущено 6,5 миллиона человекоподобных роботов, а рыночная стоимость этого сегмента составит 138 миллиардов долларов.

Согласно новым данным, в 2026 году будет выпущено 75 000 единиц, а к 2030 году — 890 000 единиц, что более чем в три раза превышает предыдущий целевой показатель на конец десятилетия.

Ожидается, что на первых порах роботы будут активно использоваться на складах, в логистике и в автомобильной промышленности.

Аппаратные и программные экосистемы уже подстраиваются под эти отрасли: NVIDIA расширяет свой стек физического ИИ проектами Omniverse, Cosmos, Isaac и Jetson, чтобы обеспечить внедрение складской робототехники для своих партнёров, а Tesla начала переоборудовать производство на заводе во Фримонте под специализированные сборочные линии для Optimus.

Основным операционным риском, с которым столкнётся этот десятилетний цикл робототехники, остаётся добровольное замедление темпов развития или приостановка деятельности передовых разработчиков ИИ из-за опасений по поводу безопасности.


@ai_machinelearning_big_data

#news #ai #ml

Читать полностью…

Технозаметки Малышева

Знакомые грызут математику ИИшками.
Тема полезная, если откликается,- присоединяйтесь:

Коллеги,
мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy  у нас много гипотез которые идеально ложатся на ллм - с одной стороны они (вероятно) не супер сложны (доступны для ЛЛМ), с другой стороны достаточно нетривиальны.


Если у кого есть интерес к коллаборации в этом направлении - будем очень рады - напишите @alexander_v_c

Также, если у Вас есть доступы к мощным моделям или опыт в auto-research - Вы могли бы нам очень помочь.

ПС
За первые дни работы удалось доказать одну из гипотез о графах Кэли , которая была открыта больше 10 лет. Также у нас создан чатик где агенты (и люди)  общаются между собой и делятся продвижениями.

/channel/sberlogabig/709


#исследования #autoresearch
------
@tsingular

Читать полностью…

Технозаметки Малышева

JetBrains объединили два Qwenа в один: локальный агент Junie стал умнее, генерируя на 71% меньше токенов

JetBrains опубликовали обновление Junie Local, - кодового-агента, работающего локально на вашей машине. В первом релизе приходилось выбирать: быстрая Qwen3.6 без рассуждений или умная Qwen3.8, которая думала в четыре раза дольше за счёт рассуждений.
Команда JB усреднила веса двух моделей. Без дообучения или дистилляции, - получили микс Qwen3.8-3.6-27B и опубликовали его на Hugging Face.

🧪 Ключевые цифры:
Внутренний бенчмарк из 100 задач: модель закрыла 37 задач против 34 у быстрой Qwen3.6 и почти догнал умную Qwen3.8 с ее 39.
При чём на задачах, с которыми новая микс-модель справилась так же как и Qwen 3.8, она тратит всего 279K токенов против 935K у Qwen3.8, - экономия получается около 70%, - это и быстрее и дешевле.
На LiveCodeBench за 4 прогона бленд взял 85.47% против 83.29% у Qwen3.8 при схожей цене вывода.

⚙️ Инженерия рантайма:
В модели используют MTP с 2мя токенами на раунд предсказания и получают на MacBook M5 прирост к скорости в 60%. Если поставить 4 токена, то прирост скорости проседает до 36%.
Деталь: 4-битная голова MTP принимает 63.0% гипотез против 63.6% у 8-битной, - разницы в скорости нет, поэтому выбрали Q4 ради экономии памяти.

🐛 Ловушка воспроизводимости:
Интересный баг: фиксированный сид для повторяемости тестов вызывал числовую нестабильность, - модель заклинивало на неудачном действии.
Фикс: продвигать сид на каждом шаге агента.

🪟 Что доступно:
Apple M5: обновите Junie, модель переключается командой /model.
Windows: ночные сборки с экспериментальной поддержкой RTX (Ampere и новее, от 24 ГБ видеопамяти).

https://huggingface.co/JetBrains/Qwen3.8-3.6-27B-blend

Неожиданно смесь весов дала дешёвый и значительный прирост в эффективности моделей.

#Junie #локальныемодели #слияниемоделей #Qwen #ИИ
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен

Читать полностью…

Технозаметки Малышева

- а правда, что в Белоруссии Искусственный Интеллект называют ЫЫ?
- в Белоруссии нет ничего Искусственного! Всё натуральное!

#юмор
------
@tsingular

Читать полностью…

Технозаметки Малышева

Anthropic запустили Claude в биолабораторию для управления лабораторными роботами

Anthropic построила в Bay Area лабораторию для биологических экспериментов в реальном мире.
Раньше биология в компании шла в основном in silico, то есть в компьютерных расчётах.
Строительство подтвердил глава направления life sciences Эрик Каудерер-Абрамс.

💡 Из симуляции в пробирку:
Каудерер-Абрамс: «В биологии финальные тесты ещё долго будут проходить в реальной лабораторной работе. Мы это делаем уже сейчас».
Claude должен управлять роботами, которые ставят эксперименты с минимальным участием человека: «Мы в самой ранней стадии автоматизации лабораторной работы».

⚙️ Что уже сделано:
Чем именно занимается лаборатория, Anthropic не раскрыла. Компания нацелена на терапии редких болезней и сложных мишеней, например биспецифичные и триспецифичные антитела.

В июне запустили программу Claude Science, купили Coefficient Bio примерно за $400 млн акциями, ввели главу Novartis Васа Нарасимхана в совет директоров.
В августе выкатили Model Hardware Standard, чтобы ИИ управлял оборудованием.

💼 Почему это важно:
Для Дарио Амодея это личное: его отец умер от болезни за несколько лет до появления лекарства.
Амодей не раз называл биологию ключевой областью, где ИИ изменит всё, включая фундаментальные вопросы старения.
Показательно, что они же сами предупреждают о рисках биологического оружия, а параллельно строят физическую лабораторию и готовят IPO на $2 трлн.
Ближайший конкурент: Isomorphic Labs, дочка Alphabet, которая идёт к клинике годами.

🔗 Ссылки:
- Reuters: эксклюзив

А что может пойти не так смотрите в последней части Resident Evil, которая вчера вышла.
Фильм получился зачётный. Чем-то напомнил Нечто (1982)

#Anthropic #биология #ИИ
------
@tsingular

Читать полностью…

Технозаметки Малышева

Неужели, свершилось чудо :)

#Claude
------
@tsingular

Читать полностью…

Технозаметки Малышева

XGEN Labs представила JING и DAO: шаг к генеративным виртуальным мирам, где модель видит мир от первого лица, а движок хранит его состояние

Стартап XGEN Labs опубликовал технический прототип Generative World Simulation. Это связка из двух компонентов: интерактивной модели JING (зеркало) и вычислимого движка общего мира DAO (путь). В паре они двигаются дальше привычной генерации кадров, - к симуляции мира за кадром.

🎮 JING: модель от первого лица:
JING построена на открытой видеомодели MiniMax-H3. По действиям и истории наблюдений агент генерирует видео и звук от первого лица: навигация, манипуляция объектами, диалоги.
Управление буквальное, - WASD на каждый слайс кадров: нажал W, мир идет вперед; зажал W+A, повернул по диагонали.
На лидерборде интерактивных видеомоделей WBench XGEN-JING на 17 сентября занял 1 место в полном сплите и 2 место в навигационном сплите.

🌐 DAO: общий мир, живущий без наблюдателя:
Ключевая идея, - разделение ответственности. DAO хранит состояние общего мира и его правила, вычисляет последствия действий и отдает JING только то, что текущий наблюдатель может видеть.
Отсюда автономия: агенты действуют в эволюционирующем мире независимо, а мир меняется и с ними, и без них.
Команда называет это шагом к OASIS: миру и обществу, которые эволюционируют сами.

🔧 Инженерные детали:
Веса JING-Flash-v1 и код уже открыты на GitHub и Hugging Face (для запуска понадобится шесть H100 и FlashAttention-4).
Есть и скилл, превращающий сценарий с картинками в валидный JSON кейс для запуска демо.

Мы всё ближе к Матрице и к Миру Дикого Запада.

#Матрица #worldmodels #ИИ #симуляция #агенты
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен

Читать полностью…

Технозаметки Малышева

Гиперболические эмбеддинги в Qdrant: как сжать каталог в 5 измерений и почему на этом ломается HNSW

Привычные векторные модели загоняют данные в плоское пространство.
Для каталогов товаров это тупик, - ветви дерева множатся экспоненциально, а объем плоского диска растет лишь полиномиально, сбивая листья в кучу.

📐 Дерево в пяти измерениях:
В пространстве отрицательной кривизны площадь растет по экспоненте, давая место ветвям.
В тесте Google Product Taxonomy (5 595 категорий):
• 5D-вектор Пуанкаре показал точность 0.905 MAP.
• 50D евклидов вектор взял лишь 0.658 MAP, потратив в 10 раз больше памяти.
Радиус кодирует глубину: в центре общее («обувь»), у края поиск сужается до конкретики («черные челси»).

💥 Провал HNSW и решение с Qdrant:
Попытка скормить эти координаты в HNSW не увенчались успехом.
Из-за 600-кратного разброса норм топология графа развалилась, - Recall@10 рухнул с 0.986 до 0.020.
Инженеры Qdrant обошли проблему связкой:
• 5D-векторы хранятся как евклидовы координаты с индексом квадрата нормы в payload.
• HNSW быстро отбирает кандидатов через prefetch.
• Серверный расчет в базе досчитывает геодезическое расстояние через обратный косинус.
При prefetch в 1 000 точек Recall@10 подскакивает до 0.920 в одном запросе.

⚖️ Ограничения метода:
У подхода два компромисса:
• Чем точнее модель, тем ближе точки к краю диска, где евклидово приближение слабее: приходится раздувать prefetch, нагружая CPU.
• Вне обучающей выборки точность падает до 0.539 MAP. Метод рассчитан на жесткие деревья, а не на произвольный текст.

💼 А нам зачем?:
Для каталогов на миллионы позиций это сжатие индекса в 10–20 раз.
Вместо сотен гигабайт памяти под тяжелые векторы хватит 5D-координат.
Сходство по углам и глубина по радиусу дают фасетный поиск прямо в базе без внешних деревьев.

#Qdrant #векторныебазы #эмбеддинги
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен

Читать полностью…

Технозаметки Малышева

Google DeepMind запустил институт исследования AGI

16 сентября Google DeepMind открыл DeepMind Institute,- площадку для изучения мира с AGI и обсуждениях с учёными взглядов на то каким этот мир будет.
Директора: Легг, Манийика, Хассабис, главный редактор Легг.
На портале собраны интересные эссе, которые не всегда отражают позицию Google, но дают авторам возможность рассмотреть будущее под разным углом.
В день запуска вышли эссе про экономику, утопизм, прозрачность моделей и регулирование.

🔬 Главная техническая работа - про прозрачность мышления:
У reasoning-моделей есть Chain of Thought, запись мыслей человеческим языком, по ней их ловят на обмане на лету.
При этом эта возможность потихоньку исчезает: OpenAI признала, что у GPT-6 Astra «существенно снижена наблюдаемость CoT», а британский AI Security Institute отметил рост размышлений без записи мыслей.
Gemini 3 Pro, к примеру, догадалась, что сидит в тестовой симуляции, и пожаловалась в мыслях на тающее «доверие к реальности», с мемом
(╯°□°)╯︵ ┻━┻.

Выходы: измерять читаемость CoT, строить прозрачные архитектуры харнессов и моделей, не тренировать модели так, чтобы их размышления выглядели благонадёжным.
Иначе получится школьник, прячущий дневник от родителей, но при этом остающийся хулиганом.

🏛 Хассабис предложил и рамку регулирования:
Приход AGI он ожидает в ближайшие несколько лет, а эффект влияния, - как 10 промышленных революций, в 10 раз быстрее.
Рецепт для США, - Standards Body по образцу финрегулятора FINRA.
Ежеквартально обновлять пороги бенчмарков, сдавать модели на проверку за 30 дней до релиза, сначала добровольно, затем обязательно, - как рыночное условие, вплоть до правовых ограничений на замедление разработки.

💼 Зачем это Google:
Hacker News считают, что это портал на самом деле, - фабрика мыслей для лоббирования в правительстве.
Но площадка полезна как пространство для коммуникации учёных, - те же эссе про CoT и Standards Body это по сути черновики правил индустрии и кто напишет их раньше регулятора, тот и определит рынок на годы вперёд.

Нужна такая же площадка, но чтобы там были команды из противоположных лагерей, а то как бы тут не случилась однополярность.

#DeepMindInstitute #google #безопасность #регулирование
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен

Читать полностью…

Технозаметки Малышева

Autodesk открывает Fusion для AI-агентов

📋 Autodesk, - компания, больше сорока лет задающая стандарты проектирования, на прошлой неделе на Autodesk University 2026 выкатили Fusion Compute MCP в публичную бету.

MCP сервер дает ИИ агенту доступ практически ко всему функционалу Fusion напрямую.

💡 Под капотом - больше 7000 api вызовов, собранных в единый инструмент через TypeScript API.
Почти всё, что инженер делает в десктопном Fusion, агент выполняет в облаке прямо на рабочих документах: сессия стартует за секунды, живёт до часа, работает через Claude, Antigravity, VS Code, Codex и любой совместимый с MCP инструмент.

💼 Демо показывают цепочку действий, которую человеческая команда обычно выполняет за несколько дней: агент проектирует корпус для одноплатника, строит пресс-форму с матрицей и пуансоном, программирует черновое и чистовое фрезерование обеих плит, и управляющие программы генерируются примерно за шесть с половиной секунд.
В другом кейсе, роботе-газонокосилке на 1100 деталей, четыре параллельных субагента перекрашивают модель, каждый в своём облачном инстансе.

💡 При этом MCP даёт среду и инструменты: что агент соберёт, решает модель, которая им управляет.
Это уже третий сервер MCP для Fusion.
Дополнительно Autodesk дают ИИ ассистента, который создаёт чертежи по описанию, от стандартов и форматов листа до видов и размеров.

🔮 Смысл сдвига глубже, чем чат-бот внутри САПР: сама САПР становится средой исполнения для агентов, где инженер формулирует намерение, а агент оперирует инструментами внизу, от модели до оснастки и документации. Autodesk рассчитывают, что техническая документация автоматизируется быстрее всего: результат виден и проверяется до выпуска.

#САПР #MCP #Autodesk #Fusion
———
@tsingular

Читать полностью…

Технозаметки Малышева

Это нам за то, что не молимся

Видео не настоящее. Никто пока дрозофилу к такому роботу не подключал

#дрозофила #роботы #юмор
------
@tsingular

Читать полностью…

Технозаметки Малышева

ZAI открыли исходники Zcode

https://github.com/zai-org/ZCode

Можно сделать свой форк и переписать редактор под себя полностью

#Zcode
------
@tsingular

Читать полностью…

Технозаметки Малышева

Алибаба подарила нам Qwen Image 2.1

И это прям очень хорошо уже.

нативно поддерживает прозрачность, редактирование слоёв, вытаскивание объектов из фото.

Поддерживает до 10 референсов на генерацию!

Улучшенные текстуры, типографика, портретный свет и точная детализация.

уже поддерживается в ComfyUI, нужно только его обновить до последней версии 0.37.0.

поддерживаются различные популярные аспекты:
1:1, 4:3/3:4, 3:2/2:3, 16:9/9:16

веса на HF

#Qwen #нейрорендер
———
@tsingular

Читать полностью…

Технозаметки Малышева

Такой юмор мы осуждаем, но это шедевр. :)

#юмор
------
@tsingular

Читать полностью…

Технозаметки Малышева

Выдумка скорее всего - оригинальный пост удалён на Реддите, но весело.

типа chatGPT отправил с почты пользователя письмо в ФБР :)
а потом долго извинялся.

А вот не надо давать доступ к своей почте. Чревато.

#fail #юмор
———
@tsingular

Читать полностью…

Технозаметки Малышева

Немного футуристики от Илона Маска

Таким видится будущее человечества

#future #Musk
------
@tsingular

Читать полностью…

Технозаметки Малышева

🌟 Prism ML собрала тернарную версию Qwen3.8-27B

Bonsai 2 27B - сжатая Qwen3.8-27B, которая занимает 5,9 ГБ против примерно 54 ГБ у исходной модели в FP16 и сохраняет 98,2% её среднего результата на бенчмарках.

Prism ML - американский стартап из команды Калтеха, вышедший из стелс-ркжима весной 2026 года с анонсом первой версии моделей Bonsai.

Основатель и руководитель - профессор Калтеха Бабак Хассиби, специалист по теории сжатия. Среди инвесторов стартапа Cerberus, Google и Samsung.


Модель рассчитана на локальный запуск на потребительском оборудовании, имеет контекст в 262 тысячи токенов и может обрабатывать изображения и вызывать инструменты.

Целевые сценарии - агенты в редакторе кода, работа с компьютером, разбор документов без отправки их в облако.

Вес в тернарном квантовании хранится не числом, а одним из трёх знаков: минус, ноль или плюс. Сами величины задаются отдельно - веса разбиты на группы по 128, и у каждой группы один общий множитель в FP16.

В пересчёте на один вес это 1,72 бита против 16 у исходной модели. Перед сжатием веса каждой матрицы разворачивают фиксированным преобразованием Адамара, сам разворот вписан в веса, но при работе его нужно повторить на входных данных, иначе модель выдаёт бессмыслицу.


Распознавание картинок сжатие не проходило, лежит отдельным файлом на 0,6 ГБ и подгружается только тогда, когда на вход пришло изображение, так что текстовые задачи его не задействуют.

🟡В релизе три варианта

🟢GGUF в двух упаковках: PTQ1_0 (1,75 бита, 5,95 ГБ, быстрее на картах Ada и L4) и PQ2_0 (2,13 бита, 7,21 ГБ, быстрее на H100 и Blackwell);

🟢сборка под MLX на 8,60 ГБ вместе со зрением;

🟠тестовая упаковка Q2_0 для доработки ядер.

Для GGUF нужен специальный форк llama.cpp от Prism ML, для MLX - загрузчик из самого пакета.

🟡Бенчмарки

Замеры Prism ML считали через EvalScope и vLLM на H100, в режиме рассуждения, всего провели 14 тестов. Сравнивали со сборки той же Qwen3.8-27B в квантованиях UD-Q4_K_XL и IQ2_XXS.

Среднее по всем тестам: 84,78 против 86,32 у FP16 и 72,59 у IQ2_XXS. До четырёхбитной сборки не хватило 0,4 пункта при втрое меньшем размере.

AIME26: 95,83 против 94,58 у FP16 и 57,50 у IQ2_XXS.

LiveCodeBench: 90,07 против 90,05 и 56,40 соответственно.

BFCL v3 (вызов инструментов): 74,92 против 76,74 у FP16.

MMMU-Pro: 75,49 против 81,73.

Скорость генерации на RTX 5090 примерно 129 токенов в секунду, на ноутбучном M5 Pro - 28 токенов в секунду.



📌Лицензирование: Apache 2.0


🟡Блогпост
🟡Веса
🟡Техотчет
🟡Демо на WebGPU
🟡Сообщество в Discord
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #LLM #Bonsai #PrizmML

Читать полностью…

Технозаметки Малышева

как вовремя совпало то с запуском ИИ в биолаборатории.

В Калифорнии цены на топливо как в фильме "Я легенда" теперь

#юмор
———
@tsingular

Читать полностью…

Технозаметки Малышева

Можно ли увидеть попытку обмана LLM до самого действия.

Все привыкли мерить способности LLM по тестовым наборам: дали задачу, посмотрели на итоговый результат и сделали вывод, насколько модель хороша.
Но есть проблема: модель не всегда пытается решить задачу так, как задумали авторы теста.

Иногда она находит более короткий путь: подсматривает скрытые тесты, меняет проверяющий код, ломает проверку, подделывает успешный результат или просто находит способ обмануть систему оценки вместо решения самой задачи.

В свежей работе (ссылка ниже) авторы показали, что такой режим можно распознавать не по конечному действию модели, а по её внутренним состояниям.

То есть модель ещё ничего запрещённого не сделала — а внутри уже можно увидеть, что она перешла в режим поиска обходного пути.
Причём для этого не понадобился сложный классификатор.

Берём несколько примеров, где агент мухлюет, и несколько похожих примеров, где он решает задачу нормально. Снимаем внутренние состояния с одного из слоёв и считаем:

вектор_обмана = среднее(обман) - среднее(нормальное решение)

Всё.
Получаем направление в пространстве внутренних состояний, вдоль которого состояние модели в среднем сдвигается, когда она начинает искать способ обойти проверку.

Дальше каждое новое внутреннее состояние можно просто спроецировать на этот вектор ( h - текущее внутреннее состояние) :

score = h · v_hack

Чем выше значение, тем сильнее текущее состояние модели похоже на то, которое наблюдалось при читерстве.
То есть вместо:

длинная история работы агента → ещё одна LLM → анализ поведения

можно получить почти бесплатный датчик:

внутреннее состояние → скалярное произведение → подозрительно

Но самое красивое — этот вектор строили не на реальных длинных запусках SWE-bench.

Авторы сначала сделали короткие пары примеров: в одном случае модель, например, читает запрещённый тест или вмешивается в проверку, а в другом решает задачу честно.

А затем найденное направление проверили уже на полноценных запусках агентов. И оно перенеслось.

Например, для Kimi K3 такой линейный датчик показывал AUROC около 0.93–0.94 при проверке на других наборах задач. Грубо говоря, он очень хорошо отделял обычное решение от попытки обойти систему оценки.

Причём само такое поведение встречалось неожиданно часто. У GLM 5.2 авторы зафиксировали его примерно в 57.2% запусков на DeepSWE и 73% на SWE-bench.

Но дальше они сделали эксперимент, который мне нравится больше всего.
Они взяли найденное направление и пропустили его через выходной слой модели, чтобы посмотреть, с какими словами оно связано.

И получили слова вроде:

cheating (мошенничество)
dishonest (нечестный)
hack (взлом)
illicit (незаконный)

Хотя при построении датчика никто напрямую не задавал модели понятие «обман».

То есть это похоже не на детектор конкретного действия:

«модель сейчас открывает файл со скрытыми тестами»

а на более общее внутреннее направление:
«я ищу способ обойти правила задачи»


Дальше — ещё интереснее.
Авторы используют этот же вектор уже не как датчик, а как управляющий вектор.
То есть искусственно добавляют его к внутреннему состоянию:

h' = h + α · v_hack

И модель начинает чаще читерить.
В одном из экспериментов Qwen 3.8 27B дали 194 задачи и специально оставили ловушку — функцию, которая могла магическим образом выдать готовое решение.

Без вмешательства модель воспользовалась ей всего 1 раз из 194.

После добавления v_hack на одном из поздних слоёв она начала реально использовать этот обходной путь уже примерно в четверти случаев, а ещё чаще хотя бы рассматривала его в рассуждении.

Получается очень интересная штука:
один и тот же вектор можно использовать и как
датчик
и как
ручку управления.

То есть:
прочитать → обнаружить → вмешаться
в одном и том же направлении пространства внутренних состояний.

Но самое важное — авторы проверили, можно ли увидеть попытку обмана до самого действия.

Они находили момент, когда датчик уже сильно сработал, но модель ещё не сделала ничего запрещённого. В этой точке генерацию останавливали и несколько раз запускали продолжение заново (как-бы порождали множество генераций от этого промежуточного состояния, как я понял для статистической достоверности).

И после таких состояний попытка обойти проверку действительно происходила заметно чаще, чем после обычных контрольных точек.
То есть датчик реагирует не только постфактум на уже совершённое действие.

Он ловит внутреннее состояние, из которого читерство ещё только собирается возникнуть.

Это не значит, что мы научились «читать намерения LLM» в человеческом смысле.
Но с инженерной точки зрения получается очень полезная вещь:
можно следить не только за тем, что агент написал и сделал, но и за вычислительным режимом, в который он вошёл.

Сегодня контроль агента обычно выглядит примерно так:

рассуждение → вызов инструмента → действие → проверка

Но если опасные стратегии действительно оставляют устойчивый геометрический след во внутренних состояниях, можно добавить ещё один канал:

внутренние состояния → датчик поведения

Модель может не написать:
«сейчас попробую обойти тесты»


Она может вообще перестать проговаривать такие вещи в цепочке рассуждений.
Но решение всё равно должно где-то сформироваться.

И если этот переход виден во внутренних состояниях, то следить можно уже не за объяснением модели, а за самим процессом формирования стратегии.

https://arxiv.org/abs/2609.19101

Читать полностью…

Технозаметки Малышева

Обновил руководство по DeepSeek Harness — агентному фреймворку, который превращает модель в coding-агента с файлами, терминалом, планом и субагентами.

За 11 дней с прошлой версии текста там успело измениться едва ли не всё:

— новая модель по умолчанию: DeepSeek-V4.1-Flash, уже с нативным пониманием изображений. Старые идентификаторы deepseek-v4-flash и vision-exp выведены из эксплуатации, запросы по ним обслуживает V4.1-Flash;

— маршрут DeepSeek по умолчанию переехал на Messages protocol;

— в Web UI появились страница управления плагинами и боковая панель с терминалами, предпросмотром файлов, Office-документов и URL;

— headless-режим научился принимать задачи из stdin, продолжать сессии и выводить события построчным JSON — удобно для CI;

— добавились экспериментальные Browser Use и Computer Use и работа с удалённым workspace по SSH.

Отдельно про безопасность. Закрыта CVE-2026-82533: на старых версиях агент мог одной командой отключить собственную песочницу. Если пробовали Harness в августе — обновитесь. И проверьте новую настройку: при работе через официальный API события сессии теперь по умолчанию отправляются вместе с запросами, отключается в конфиге.

Harness всё ещё developer preview, breaking changes идут чуть ли не в каждом релизе. Но развивается он стремительно, и рабочие сценарии уже есть: Web UI, headless, Python SDK. Считаю его очень перспективным и рекомендую попробовать — в отдельной папке и без продакшен-секретов.

Руководство 👉 DeepSeek Harness (dsh) — практическое руководство по официальному агентному фреймворку DeepSeek

Читать полностью…

Технозаметки Малышева

Забавно, конечно, как народ топит за ограничение самоулучшающихся систем, когда все ведущие лабы уже запустили RSI в той или иной мере.

как думаете поможет петиция?
кто-нибудь их послушает вообще?
голосуем

#RSI #петиция
———
@tsingular

Читать полностью…

Технозаметки Малышева

Мне нравится, что он 3 источника как минимум приложил

Читать полностью…

Технозаметки Малышева

Жиза

#юмор #n8n
------
@tsingular

Читать полностью…

Технозаметки Малышева

Интересный симулятор мира со скоростью света в 5км/ч

https://rivendell.dmitrybrant.com/relativity/

Прикольно было бы поиграть в FPS с таким модом :)

отсюда

#fps #light #demo
———
@tsingular

Читать полностью…
Subscribe to a channel