TGTGInsighttelegram intelligenceLIVE / telegram public index
← GZ学习频道

TGINSIGHT SIMILAR POSTS

Find similar content

Source channel @olddriverGDstudy · Post #51 · Mar 24

#上头诫#知识 噫吁嚱,呜呼哀哉。佳丽之心, 如渊似海云雾间。前有鬼者心有属,今有上将四人间。心似骄阳深似火,怎当白桓是真心。柳间戏水不得喻,错将弱颜当磐石。今日不见凄鬼之心散步言语现,此时却如千万金石尽如吼头甜。千言万语悬浮脑海间,百转千回纠缠心火炼。上将游戏四水间,怎奈四水通流涧。不得可可不得乖,碧水深潭心坏怜。心知真己不觉少,奈何四水风见消。索向索梁不觉走,回神已在深涧见。深涧云气鬼雾袅,崖山悬顶有佳囡。云烟做红霞,鬼雾做红妆。似是云波似是锦,可文鬼泣是有心。东升日出朝阳起,云散无效鬼泪去。不知南柯曾觉晓,梦里梦外梦惺惺。囡囡心念念,鬼鬼向戚戚。柳七窃窃似潇潇,新年却已入人牢。谁知何时却明晓,涉水不足总深腰。无问无知无所念,有情有景有春宵。尽知尽晓秀哥谣,不管不顾十诫飘。愿此流真做悲景,莫要上头惹人笑。

Results

1 similar post found

Search: #roberta

当前筛选 #roberta清除筛选
Machinelearning

@ai_machinelearning_big_data · Post #8817 · 10/20/2025, 08:41 PM

⚡️BERT is just a Single Text Diffusion Step Любопытны пост, где автор объяснил на примере очень простую и очевидную, но мощную идею. Он заметил, что то, что мы называем диффузией текста, на самом деле - это просто обобщённая версия классического обучения BERT. Как работаетBERT? В BERT модель берёт текст и маскирует часть слов, а потом учится угадывать, какие слова были скрыты. В диффузии происходит почти то же самое, только шагов больше: на каждом шаге модель немного «портит» текст (добавляет шум), а затем восстанавливает его, всё меньше и меньше теряя смысл, пока не соберёт финальный чистый текст. То есть BERT делает один шаг очистки - угадывает замаскированные слова. А диффузионная модель делает много таких шагов подряд, постепенно превращая случайный набор токенов в осмысленный текст. Барри дообучил RoBERTa, чтобы показать это на практике - и получил настоящий текстовый диффузионный генератор. В примере: - Используется RoBER (улучшенная версия модели BERT,) и датасет WikiText. - На каждом шаге часть токенов заменяется на <MASK>, модель восстанавливает их, потом снова маскирует — и так несколько раз. - После нескольких итераций модель способна генерировать связный текст, даже без автогенеративного декодера (как у GPT). 📈Результаты - Модель генерирует осмысленный текст, хотя и не идеально связный. - Качество улучшалось по мере добавления шагов диффузии. - По времени генерации RoBERTa Diffusion была немного медленнее, чем GPT-2 (~13 сек против 9 сек), но архитектура осталась полностью encoder-only. Автор упоминает, что позже наткнулся на работу DiffusionBERT, где идею реализовали глубже и подтвердили результатами. Главная мысль: BERT можно считать одноступенчатой версией текстовой диффузии. Если добавить больше шагов, то vs получаем диффузионный генератор текста. Если BERT - это один шаг диффузии, то будущее может принадлежать моделям, совмещающим "понимание" и "генерацию" текста в одном процессе. https://nathan.rs/posts/roberta-diffusion/ @ai_machinelearning_big_data #AI#Diffusion#RoBERTa#BERT#LanguageModel#MLM#Research