Намери подобно съдържание

Изходен канал @clockstackwheels · Post #851 · 2.08

Впервые использовал нейросетку для реальной практической пользы в коммерческом заказе. У заказчика есть база данных, куда информация вносится кое-как. Представьте, что вы составляете каталог, например, книг, и в базе данных предусмотрены поля: "Автор книги", "Название книги", "Число страниц" и ещё десяток других полей с информацией. Но заполняют эту базу другие люди, которых вы не контролируете, поэтому информация может случайным образом лежать в любом произвольном поле, быть введена с ошибками, опечатками и так далее. В реальном заказе были не книги, я просто привожу пример такой же задачи. Вот как это может выглядеть: 1. В поле "Автор" написано "Лондон, Дж. Белый Клык", поле "Название" при этом пустое. 2. В поле "Название" написано "150-страничный сборник рецептов", поле "Число страниц" пустое 3. В поле "Название" написано "джеклондон мартин иден", поле с автором пустое 4. В поле "Автор" написано "150-стр.3изд,доп.перераб инструкция по пользованию подстанциями типа ТП-13, М.Васильев москва 98" ...и так далее. А нужно искать нормально по автору, названию, числу страниц, городу и году издания. Никакими прямыми алгоритмами это не берётся: регулярки, поиск по ключевым словам, морфология, нечёткая логика — всё это либо даёт много ложноположительных результатов, либо (если подкрутить пороговые значения) вообще перестаёт искать. И вот тут в какой-то момент мы решили попробовать запрашивать через API GPT. Нейросетке задаётся следующий промт: "Есть следующая информация: «150-страничный роман джеклондон мартин иден». Если здесь есть то, что похоже на имя автора книги, напиши мне его, иначе ответь null". И, надо сказать, даже 3.5 справляется с этой работой очень хорошо. Получилось сравнительно без ошибок разметить около 80% данных (остальные с ошибками даже после нейросетки). Но, важный нюанс. Сначала мы пытались поймать все данные одним запросом: "GPT, выведи мне JSON, в котором есть автор, название, число страниц...", но тесты показали, что значительно эффективнее будет отдельно спросить 5 раз про 5 разных типов данных. Да, это расходует больше токенов, но они и так сравнительно дёшевы. Кстати, API у OpenAI безбожно глючит даже на платном тарифе. Обещанных 3500 запросов в минуту нет даже приблизительно. По факту удаётся отправлять около 200-300 запросов в минуту, потом оно вываливается в таймауты или ошибку 429, нужно делать какие-то умные паузы, ждать итд. Над этим всем пришлось повозиться, зато результат вполне ощутимый. #dev

Hashtags

#dev

Резултати

Намерени 2 подобни публикации

Търсене: #bert

当前筛选 #bert清除筛选

Machinelearning

@ai_machinelearning_big_data · Post #8817 · 20.10.2025 г., 20:41

Намери подобни Прегледай

⚡️BERT is just a Single Text Diffusion Step Любопытны пост, где автор объяснил на примере очень простую и очевидную, но мощную идею. Он заметил, что то, что мы называем диффузией текста, на самом деле - это просто обобщённая версия классического обучения BERT. Как работаетBERT? В BERT модель берёт текст и маскирует часть слов, а потом учится угадывать, какие слова были скрыты. В диффузии происходит почти то же самое, только шагов больше: на каждом шаге модель немного «портит» текст (добавляет шум), а затем восстанавливает его, всё меньше и меньше теряя смысл, пока не соберёт финальный чистый текст. То есть BERT делает один шаг очистки - угадывает замаскированные слова. А диффузионная модель делает много таких шагов подряд, постепенно превращая случайный набор токенов в осмысленный текст. Барри дообучил RoBERTa, чтобы показать это на практике - и получил настоящий текстовый диффузионный генератор. В примере: - Используется RoBER (улучшенная версия модели BERT,) и датасет WikiText. - На каждом шаге часть токенов заменяется на <MASK>, модель восстанавливает их, потом снова маскирует — и так несколько раз. - После нескольких итераций модель способна генерировать связный текст, даже без автогенеративного декодера (как у GPT). 📈Результаты - Модель генерирует осмысленный текст, хотя и не идеально связный. - Качество улучшалось по мере добавления шагов диффузии. - По времени генерации RoBERTa Diffusion была немного медленнее, чем GPT-2 (~13 сек против 9 сек), но архитектура осталась полностью encoder-only. Автор упоминает, что позже наткнулся на работу DiffusionBERT, где идею реализовали глубже и подтвердили результатами. Главная мысль: BERT можно считать одноступенчатой версией текстовой диффузии. Если добавить больше шагов, то vs получаем диффузионный генератор текста. Если BERT - это один шаг диффузии, то будущее может принадлежать моделям, совмещающим "понимание" и "генерацию" текста в одном процессе. https://nathan.rs/posts/roberta-diffusion/ @ai_machinelearning_big_data #AI#Diffusion#RoBERTa#BERT#LanguageModel#MLM#Research

Hashtags

#ai #diffusion #roberta #bert #languagemodel #mlm #research

KillMilk

@killmillk · Post #167 · 05.06.2025 г., 11:00

Намери подобни Прегледай

Исследователи геопространства или сотрудники американских спецслужб, помогающих Украине!? 🤔 ‼️Знакомьтесь, командование специальных операций ВС США (англ. United States Special Operations Command; USSOCOM или SOCOM) ⏩️Список пользователей Rover (Maxar Tehnologies) Armen Kurginyan - arm####@hotmail.com Adam Swain - as####@gmail.com Brian Kuleff - brian.k####@socom.mil Beau Seamans - s####[email protected] Brad Washer - brad####@gmail.com Mike Carter - Mrmi####@gmail.com S Boyd - ####[email protected] Chris D. - chris####@yahoo.com Colby L. - ####[email protected] D. Boardman - daniel.a.bo####@gmail.com Dave Hurd - ####[email protected] Gladhill village - dgla####@gmail.com Grayson Gilliatt - ####[email protected] Grady Graff - ####[email protected] Forrest Hamilton - ####[email protected] Heath B. - he####@gmail.com Justin Carmer - car####@gmail.com J. Lewis - jonathan.le####@gmail.com Joseph Brown - jos####@gmail.com Jonathan Jones - ####[email protected] Joseph Pezzino - jp####@gmail.com Justin Rood - justi####@gmail.com Karam Gill - kar####@gmail.com Nick Corinis - ####[email protected] Pat Berg - maximus####@gmail.com Parker K. - ####[email protected] Sonny Revell - rev####@gmail.com rovertraining - Ro####@socom.mil Rhett Rutledg - rhe####@rhettsmail.com Scott Gregory - bird####@gmail.com Sam Harrington - saman####@gmail.com Skyler W. - s####[email protected] Terrell Burnett - ####[email protected] Thomas Deleon - thom####@gmail.com Tom Wilson - ####[email protected] Travis Gramkov - travis.g####@gmail.com Timothy Ryan Sebert - ####[email protected] Taylor Tharp - trth####@pm.me Tom Wilson - ####[email protected] Tyler Y. - tyler_####@outlook.com Will Fenn - falcon####@gmail.com William Shaw - ####[email protected] Willwachter - ####[email protected] Wlove - waddie.####[email protected] 1st century Viarnes - wvia####[email protected] YankG - ####[email protected] WE ARE KILLNET

Hashtags

#ns #ird #y #id88 #illiatte #aff #on #is #r #k #ett1999 #ontw #bert #homas #achter #rnes #g18