Намери подобно съдържание

Изходен канал @clockstackwheels · Post #601 · 18.10

Лена у себя написала про беспомощную западную техноддержку. Я вам тоже о нескольких таких случаях из своей жизни рассказывал. Возможно, у вас ссылка не откроется, процитирую небольшой кусочек: «...современные автоматизированные поддержки, которые работают по алгоритму, задизайнены совсем не для таких людей, как я — кто инициирует синхронное взаимодействие с человеком только после того, как исчерпает ресурсы найти ответ на вопрос самостоятельно. При этом хорошо, если отвечает сразу человек — а теперь ведь нередко и робот, который в принципе никогда не может ответить на мой запрос, потому что ответы на простые вопросы я нахожу самостоятельно. И уж если я и обратилась в поддержку, то это всегда какой-то сложный вопрос или нестандартная ситуация, на который робот не ответит никогда. Но даже и с белковым агентом поддержки в последнее время все чаще натыкаешься на ситуацию, когда твоя проблема не вписывается в лекала частых вопросов и проблем и спустя десятки минут бесплодного общения <...> всё, что они делают, — это разводят руками: „Мы исчерпали наши возможности“. Более того, не эскалируют проблему тем, кто компетентен в ней разобраться и ее решить..» Это абсолютная правда, хотя в России я натыкался на такие вещи существенно реже. Либо вообще русские цифровые сервисы сделаны лучше, и приходится обращаться в саппорт меньше. Либо просто русский человек не так часто может изображать из себя идиота, даже если ему дан приказ работать по скрипту. Я задумался -- почему всё-таки поддержка у крупных компаний в основном именно такая? По крайней мере мой личный опыт весьма однозначен: за последний год было штук пять обращений в разные англоязычные сервисы, и четыре из них зависли на скрипте (не завис Гитхаб -- честно решил мою проблему). Видимо, бизнесу выгодно содержать такую поддержку и не выгодно содержать другую. Моя гипотеза: стоимость незаскриптованного человека достаточно велика, а количество не тупых обращений достаточно мало, чтобы не было смысла заморачиваться. Жаль, что в интерфейсах не делают галочки "Я не тупой". Компании могли бы содержать одного умного специалиста поддержки, он бы получал по одному сообщению в день от редких умных людей, которые действительно наткнулись на серьёзную проблему. А скрипто-обезьянки обрабатывали бы запросы, ответ на которые выпадает первой строчкой в гугле. Но, наверное, человечеству нужно идти ещё дальше и пускать в интернет людей только после сдачи экзамена по работе с интерфейсами. Да, знаю, компании и сами то не спешат сейчас делать вменяемый UI: например, была история о том, что для остановки платной подписки на Amazon нужно было сделать десяток очень неочевидных действий, нажимать на кнопки с непонятным содержимым мелким шрифтом, проматывать страницы до конца, ставить строго определённые галочки и так далее. Наказанием для таких компаний был бы отказ пользователей от их услуг, но в рамках капиталистических монополий у юзеров особо нет выбора. Возможно люди, которые когда-то сдавали сложный экзамен по UI, позже, работая в корпорациях, будут с меньшей охотой делать запарный и непонятный интерфейс. #web

Hashtags

#web

Резултати

Намерени 1 подобни публикации

Търсене: #flextok

当前筛选 #flextok清除筛选

Machinelearning

@ai_machinelearning_big_data · Post #7942 · 02.07.2025 г., 09:01

Намери подобни Прегледай

🌟 FlexTok: адаптивная 1D-токенизация изображений от Apple. FlexTok - метод токенизации изображений, который преобразует 2D-изображения в упорядоченные 1D-последовательности переменной длины. Его цель - сократить объем данных, необходимых для обучения генеративных моделей, и при этом оставить достаточную информацию для качественной реконструкции и генерации. В отличие от традиционных подходов, где число токенов фиксировано и зависит только от размера изображения, FlexTok подстраивается под сложность контента: простейшая сцена может кодироваться несколькими токенами, а сложная - десятками и сотнями . FlexTok, это по сути, пайплайн из 3 компонентов: ViT‑энкодер, квантование регистров и маскирование внимания: ViT‑энкодер с набором «регистровых» токенов читает латентные представления VAE‑GAN и конденсирует их в 1D-последовательность до 256 регистров . Затем, с помощью FSQ‑квантования, каждый регистр дискретизируется в код из заранее определенного словаря размером ~64 000. На этом этапе применяется "nested dropout": во время обучения случайно обрезаются последние токены, чтобы модель научилась упорядочивать информацию от грубых форм к деталям. Параллельно применяется авторегрессионная маска внимания: каждый токен в цепочке видит только те, что были до него, и не знает о тех, что идут после. Это заставляет модель генерировать изображения шаг за шагом, от первого токена к последнему, и упрощает ей задачу прогнозирования следующих элементов. Декодер в FlexTok - это модель rectified flow, которая на вход берет укороченные токены и слегка зашумленные латенты VAE и учится предсказывать тот шум, который нужно убрать, чтобы вернуть исходное представление. Чтобы обучение шло быстрее и давало более точные результаты, добавляют REPA‑Loss: он сравнивает промежуточные признаки с векторами из DINOv2‑L. Благодаря этому даже при очень жесткой компрессии (от 1 до 256 токенов), FlexTok успешно восстанавливает детали изображения. FlexTok легко встраивается в текстово‑ориентированные модели и может улучшить соответствие изображения описанию, даже если число токенов меняется. К тому же его адаптивная токенизация применима не только к картинкам, но и к аудио или видео. ▶️Набор токенизаторов: 🟢Flextok_d12_d12_in1k - 12\12 слоев энкодер-декодер, датасет IN1K; 🟢Flextok_d18_d18_in1k - 18\18 слоев энкодер-декодер, датасет IN1K; 🟢Flextok_d18_d28_in1k - 18\28 слоев энкодер-декодер, датасет IN1K; 🟢Flextok_d18_d28_dfm - 18\28 слоев энкодер-декодер, датасет DFN. ▶️VAE: 🟠Flextok_vae_c4 - 4 каналов латента, коэффициент понижающей дискретизации 8; 🟠Flextok_vae_c8 - 8 каналов латента, коэффициент понижающей дискретизации 8; 🟠Flextok_vae_c16 - 16 каналов латента, коэффициент понижающей дискретизации 8. 🟡Страница проекта 🟡Набор на HF 🟡Arxiv 🟡Demo 🖥GitHub @ai_machinelearning_big_data #AI#ML#Tokenizer#Flextok#Apple

Hashtags

#ai #ml #tokenizer #flextok #apple