TGTGInsightтелеграм анализLIVE / telegram public index
← Такты, стеки, два колеса

TGINSIGHT SIMILAR POSTS

Намери подобно съдържание

Изходен канал @clockstackwheels · Post #49 · 14.06

Мне очень нравится YouTube-канал Wintergatan. Вы, возможно, знаете его, но если нет, то наверняка видели 5 лет назад ролик Marble Machine — он тогда обошёл весь интернет (это НЕ тот ролик, который я приложил к посту, но тот вы без труда найдёте). Автор канала — шведский музыкант Мартин Молин — невероятно талантливый человек. Он не только мультиинструменталист с абсолютным слухом, но ещё и обладает прекрасным инженерным чутьём и изобретательскими навыками. Последние несколько лет он собирает у себя дома вторую версию этой самой Marble Machine — электромеханического музыкального инструмента, использующего для работы тысячи металлических шариков (marbles). Процесс сборки документируется на канале, и лично мне доставляет огромное удовольствие. Как человек с музыкальной школой и инженерным дипломом за плечами, я весьма высоко оцениваю и то, что делает Мартин по творческой части, и то, что по технической. Многие его инженерные решения просты в своей гениальности, при этом очень гармоничны и элегантны — как музыка :) Этот пример приближает меня к мысли о том, что противопоставление рациональной науки и иррационального искусства, равно как гуманитариев и технарей — не совсем верно. С какого-то расстояния и наука и искусство становятся очень похожи. Наш мир гармоничен, логичен и красив. И попытки отразить этот мир — хоть в картине, хоть в математической модели — неизбежно перенимают эти качества. https://youtu.be/b-nU21YgXTg #life

Hashtags

Резултати

Намерени 1 подобни публикации

Търсене: #humanomniv2

当前筛选 #humanomniv2清除筛选
Machinelearning

@ai_machinelearning_big_data · Post #7971 · 08.07.2025 г., 09:01

🌟HumanOmniV2: модель, которая понимает контекст видео. Alibaba Group разработали HumanOmniV2, модель на базе Qwen2.5-Omni-7B-thinker, которая получила навык осмысления визуального контекста за счет изменения самого процесса мышления модели. Ее научили следовать строгому формату: сначала описать контекст, потом рассуждать и только затем давать ответ. Теперь, прежде чем отвечать на вопрос, модель генерирует подробное описание сцены в теге <context>. На этом этапе она фиксирует, кто что делает, какой фон, какие звуки слышны. Только после этого в теге <think> она строит логическую цепочку рассуждений, связывая вопрос с собранным контекстом. И лишь в конце выдает результат в теге <answer> . Чтобы этот подход работал, его усилили системой вознаграждений на основе RL. За точность и правильный формат модель получает стандартные награды, но были введены и две новых: 🟢«Награда за контекст» дается, если его описание полное и релевантное, причем качество этого описания оценивает другая, более мощная LLM; 🟢«Логическая награда» проверяет, что в своих рассуждениях модель действительно использовала данные из видео и аудио, а не проигнорировала их. Для оценки HumanOmniV2 создали бенчмарк IntentBench (633 видео, 2689 вопросов) на основе Social-IQ 2.0, EMER и MDPE. Его фишка в том, что вопросы требуют одновременного анализа: видеоряда (жесты, микровыражения), диалогов (тон, смысл реплик) и социального контекста (ирония, обман, скрытые намерения). Тестовая модель обошла открытые аналоги на 3 бенчмарках: 🟠Daily-Omni: 58.47% (53.13% у MiniCPM-o 2.6); 🟠WorldSense: 47.1% (45.4% у Qwen2.5-Omni); 🟠IntentBench: 69.33% (64.20% у Qwen2.5-Omni). 📌Лицензирование: Apache 2.0 License. 🟡Модель 🟡Arxiv 🖥GitHub @ai_machinelearning_big_data #AI#ML#MMLM#HumanOmniV2#Alibaba