TGTGInsightтелеграм анализLIVE / telegram public index
← Такты, стеки, два колеса

TGINSIGHT SIMILAR POSTS

Намери подобно съдържание

Изходен канал @clockstackwheels · Post #762 · 17.02

Я просто не могу понять, на мой взгляд ВК систематически продолжает принимать максимально плохие продуктовые решения. С моей точки зрения это выглядит, будто бы какая-то компания выпускает ложку с дырой посередине, и дыру всё увеличивают. В мою картину мира просто не укладывается: какая аудитория и при каких условиях может использовать ложку с дырой посередине. ВК выпустили обновление ленты рекомендаций "Для вас", и это и по интерфейсу и по контенту просто максимально плохо. Причем, если почитать комментарии под этой новостью вообще где угодно, то люди точно так же, как я, массово офигевают. Я знаю, что мои вкусы не универсальны, и что я не владею всей информацией. Меня бесит Инстаграм, но я понимаю причины его популярности. Меня бесит ТикТок, и вообще истерия современного интернета по поводу коротких вертикальных видео — их пихают абсолютно везде, даже там, где они не пришей кобыле хвост — но и такое явление не выходит совсем уж за пределы моего представления об устройстве мира. Даже люди, которые всерьёз используют Фейсбук, находятся где-то на границе понимания для меня. Но какой продуктовый менеджер и для какой именно аудитории может выкатить стену неструктурированного визуального мусора, нарушающую даже самые банальные UI/UX-принципы, и усиливающую недостатки и без того отвратительно работающей системы рекомендаций? Обрезанные мемы, фотографии случайных предметов без важного контекста, максимально тупые клипы для имбецилов (да, слева вверху мужик с женскими трусами на голове), ещё и с автовоспроизведением. И это всё двухмерной простынёй в интерфейсе, который во всех остальных местах используют для быстрого визуального поиска чего-то заранее известного, чтобы специально ни на чём не фокусировать взгляд и не задерживать внимание. Я не понимаю, как и зачем это делается. Почему никто из сотрудников ВК не рассказывает своим внутри о том, что этот экран вызывает только желание немедленно его закрыть и больше никогда не видеть? Почему никто из сотрудников ВК не читает комментарии людей под новостями о нововведениях? Я знаю, что хейтить ВК это уже пошлятина. Но найдите мне одного человека, которому правда нравится, и пусть он мне объяснит свой взгляд на вещи. Потому что я не могу отойти от шока: какая-то важная часть понимания мира ускользает от меня. #web

Hashtags

Резултати

Намерени 1 подобни публикации

Търсене: #bfl

当前筛选 #bfl清除筛选
Machinelearning

@ai_machinelearning_big_data · Post #9625 · 05.03.2026 г., 13:26

🌟Self-Flow: обучение диффузионных моделей без внешних энкодеров от Black Forest Labs. Black Forest Labs и MIT решили проблему, с которой сталкиваются диффузионные и flow-модели: чтобы генерировать качественные картинки, им нужны сильные семантические представления. Обычно их берут снаружи - выравнивают внутренние признаки модели с признаками энкодера вроде DINOv2. Метод работает, но есть нюанс. Чем сильнее энкодер, тем хуже результат: в экспериментах замена DINOv2-B на более мощный DINOv3-H+ стойко ухудшала FID. Модель привязывалась к фиксированным внешним представлениям и переставала масштабироваться. На видео и аудио выравнивание с энкодерами V-JEPA2 и MERT вообще давало результат хуже ванильного flow matching. 🟡Self-Flow предлагает механизм Dual-Timestep Scheduling В стандартном flow matching все токены нойзятся одинаково, поэтому модель решает задачу локально и не учится строить глобальные связи. Self-Flow сэмплирует 2 разных уровня шума и случайно назначает их разным токенам (часть входа зашумлена сильнее, часть чище). Это создает асимметрию: чтобы восстановить сильно зашумленные токены, модель вынуждена опираться на чистые и строить глобальный контекст. Поверх этого работает самообучение по принципу дистилляции. Обучаются одновременно 2 копии модели: модель-ученик видит смешанный зашумленный вход, модель-учитель - более чистую версию (EMA-копия с экспоненциальным скользящим средним). Ученик учится предсказывать признаки учителя из зашумленного входа, и это вынуждает его развивать сильные семантические представления без какого-либо внешнего энкодера. 🟡Результаты тестов 🟢На ImageNet 256×256 Self-Flow показал FID 5.70 против 5.89 у REPA; Это, кстати, первый случай, когда self-supervised метод превзошел внешнее выравнивание на этом бенче 🟢На text-to-image: FID 3.61 против 3.92 у REPA; 🟢По видео: FVD 47.81 против 49.75 у REPA; 🟢По аудио: лучшие FAD-оценки среди всех вариантов. При этом на масштабировании (с 290M до 1B) разрыв с REPA увеличивается: модель Self-Flow на 625M параметров обходит REPA на 1B. Метод универсален для модальностей - он работает одинаково на картинках, видео и аудио, что намекает на применение для мультимодального обучения. В репозитории проекта есть код инференса на основе SiT-XL/2 с per-token timestep conditioning, чекпоинт на основе ImageNet 256×256 и скрипты для генерации сэмплов под FID-оценку через ADM evaluation suite. Поддерживаются режимы SDE и ODE, мульти-GPU через torchrun. 🟡Статья 🟡Техотчет 🖥GitHub @ai_machinelearning_big_data #AI#ML#Multimodal#Framework#BFL