TGTGInsightтелеграм анализLIVE / telegram public index
← Такты, стеки, два колеса

TGINSIGHT SIMILAR POSTS

Намери подобно съдържание

Изходен канал @clockstackwheels · Post #49 · 14.06

Мне очень нравится YouTube-канал Wintergatan. Вы, возможно, знаете его, но если нет, то наверняка видели 5 лет назад ролик Marble Machine — он тогда обошёл весь интернет (это НЕ тот ролик, который я приложил к посту, но тот вы без труда найдёте). Автор канала — шведский музыкант Мартин Молин — невероятно талантливый человек. Он не только мультиинструменталист с абсолютным слухом, но ещё и обладает прекрасным инженерным чутьём и изобретательскими навыками. Последние несколько лет он собирает у себя дома вторую версию этой самой Marble Machine — электромеханического музыкального инструмента, использующего для работы тысячи металлических шариков (marbles). Процесс сборки документируется на канале, и лично мне доставляет огромное удовольствие. Как человек с музыкальной школой и инженерным дипломом за плечами, я весьма высоко оцениваю и то, что делает Мартин по творческой части, и то, что по технической. Многие его инженерные решения просты в своей гениальности, при этом очень гармоничны и элегантны — как музыка :) Этот пример приближает меня к мысли о том, что противопоставление рациональной науки и иррационального искусства, равно как гуманитариев и технарей — не совсем верно. С какого-то расстояния и наука и искусство становятся очень похожи. Наш мир гармоничен, логичен и красив. И попытки отразить этот мир — хоть в картине, хоть в математической модели — неизбежно перенимают эти качества. https://youtu.be/b-nU21YgXTg #life

Hashtags

Резултати

Намерени 1 подобни публикации

Търсене: #ssm

当前筛选 #ssm清除筛选
Machinelearning

@ai_machinelearning_big_data · Post #8750 · 13.10.2025 г., 15:05

⚡️Mamba-3 тихо и без объявления вышла на ICLR - и это может стать началом конца эпохи Transformers. Новая архитектура Mamba-3 делает модели быстрее, стабильнее и эффективнее при работе с длинными контекстами. Главная идея - не в слоях внимания, а в state-space моделях, где модель хранит и обновляет внутреннее состояние во времени. 📘Краткие эускурс: - Mamba-1 ввела непрерывную динамику и выборочное обновление памяти - помнила эффективно без высокой цены attention. - Mamba-2 показала, что обновления состояния и attention - это две стороны одной математики, что ускорило вычисления на GPU. - Mamba-3 довела концепцию до зрелости: теперь внутренняя память развивается плавнее и устойчивее за счёт перехода от простого шага Эйлера к трапецеидальному интегрированию. Вместо простого шага Эйлера, как в Mamba-2, Mamba-3 аппроксимирует интеграл обновления состояния не только по правому концу интервала, но усреднением между началом и концом, с коэффициентом λ, зависящим от данных. Это даёт более точное приближение (второго порядка) и делает динамику состояния более выразительной. 🧠Что изменилось под капотом: - Память стала «ритмичной»: теперь модель может хранить повторяющиеся и периодические паттерны (например, структуры языка или музыки). - Новый multi-input-multi-output дизайн позволяет обрабатывать несколько потоков параллельно — идеально для современных GPU. ⚙️Что это даёт на практике: - Эффективная работа с длинными последовательностями: документы, геномы, временные ряды. - Линейное время выполнения и стабильная задержка делают её идеальной для реального времени: чат-ботов, перевода, речи. - Энергоэффективность и масштабируемость открывают путь к on-device AI, где большие модели работают локально, без облака. Mamba-3 - это не просто ускоренная альтернатива Transformers. Это новая архитектура, которая объединяет глубокое понимание контекста, скорость и устойчивость, от серверных систем до умных устройств. 🟢Подробности: https://openreview.net/pdf?id=HwCvaJOiCj @ai_machinelearning_big_data #ssm#mamba3#llm,#architecture#ai