TGTGInsightаналитика telegramLIVE / telegram public index
К списку каналов
Machinelearning avatar

TGINSIGHT CHAT

Machinelearning

@ai_machinelearning_big_data

Технологии

Погружаемся в машинное обучение и Data Science Показываем как запускать любые LLm на пальцах. По всем вопросам - @haarrp @itchannels_telegram -🔥best channels Реестр РКН: clck.ru/3Fmqri

Подписчики31.3万Текущее число подписчиков
Постов1,009Проиндексировано постов
Охват107,300Просмотры последних постов
Последние посты

Последние посты

Тег: #tts · 4 постов

当前筛选 #tts清除筛选

Опубликован 15 апр.

⭐️ Google DeepMind представил Gemini 3.1 Flash TTS - свою самую управляемую модель генерации речи Главная фишка - Audio Tags. Это текстовые команды прямо в промпте, которыми можно управлять стилем голоса, подачей и темпом речи. По сути, вы режиссируете озвучку через текст. Что ещё важно: — Более естественное звучание речи — Поддержка 70+ языков (русский, японский, немецкий и др.) — Все выходные аудио маркируются SynthID (цифровой водяной знак, чтобы отличить синтезированную речь от настоящей) На бенчмарке Artificial Analysis TTS Arena модель заняла 2-е место с Elo-рейтингом 1211 - сразу за Inworld TTS 1.5 Max (1215) и выше ElevenLabs v3 (1179). Где попробовать: → Рreview через Gemini API и Google AI Studio → Бизнесу -а Vertex AI → Всем пользователям - скоро появится в Google Vids https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-flash-tts/ @ai_machinelearning_big_data #google `#tts

23,500 views

Hashtags

Опубликован 7 апр.

🌟VoxCPM2: открытая 2B TTS-модель на 30 языках. VoxCPM2 - крупное обновление открытой системы синтеза речи VoxCPM. Модель обучена на более 2 млн. часов мультиязычных аудиоданных и поддерживает 30 языков, включая русский, китайский, английский, японский, корейский, арабский и хинди (плюс 9 диалектов китайского). За проектом стоит OpenBMB, структура при Университете Цинхуа, объединяющая академическую лабораторию THUNLP и коммерческую компанию ModelBest. THUNLP - одна из сильнейших академических групп по LLM в Азии, которой руководит легенда китайского NLP, профессор Maosong Sun. OpenBMB известна сериями CPM, MiniCPM, AgentCPM и фреймворками BMTrain и OpenPrompt. 🟡В второй версии VoxCPM отказались от дискретной токенизации аудио. В отличие современных TTS-систем, VoxCPM2 работает напрямую с непрерывными представлениями в латентном пространстве AudioVAE V2. Пайплайн состоит из 4 стадий: LocEnc, TSLM, RALM и LocDiT. На выходе - аудио с частотой 48 кГц студийного качества: асимметричная архитектура AudioVAE V2 принимает референс на 16 кГц и повышает разрешение без внешнего апсемплера. 🟡Обновление добавило 2 новые возможности. 🟢Voice Design создает голос по текстовому описанию: достаточно указать пол, возраст, тембр, эмоцию и темп - никакого референсного аудио не нужно. 🟢Controllable Voice Cloning клонирует голос по короткому аудиофрагменту и в довесок позволяет управлять стилем, эмоциями и скоростью речи, сохраняя оригинальный тембр. Из версии 1.5 перешел режим Ultimate Cloning: если передать вместе с референсом его точный транскрипт, модель воспроизводит ритм, интонации и манеру речи. 🟡Тесты На Seed-TTS-eval модель показывает WER 1.84% на английском и CER 0.97% на китайском при сходстве голоса (SIM) 75.3% и 79.5% соответственно. На мультиязычном Minimax-MLS-test система лидирует по SIM в подавляющем большинстве из 24 языков, опережая Minimax, ElevenLabs, FishAudio S2 и Qwen3-TTS. В задаче генерации голоса по описанию модель набирает лучшие баллы среди open-source решений на InstructTTSEval в английском языке. 🟡Модель потребляет около 8 ГБ VRAM. Скорость инференса по соотношению времени, затраченного моделью на генерацию аудио к длительности самого аудио - около 0.3 на NVIDIA RTX 4090. На движке Nano-vLLM этот показатель снижается до 0.13 (подходит для стриминга в реальном времени). Есть скрипты и гайд для SFT (добавления нового языка или домена) или LoRA для глубокой имитации конкретного спикера. LoRA потребует 5–10 минут аудио и 20 ГБ VRAM. Пример генерации аудио на демо-спейсе HF без клонирования и постобработке - в видеофайле поста. 📌Лицензирование: Apache 2.0 License. 🟡Страница проекта 🟡Документация 🟡Модель 🟡Demo 🖥GitHub @ai_machinelearning_big_data #AI#ML#TTS#VoxCPM2#OpenBNB

20,100 views

Опубликован 22 янв.

🗣Qwen3-TTS - мощный open-source релиз (voice design + клонирование голоса) Qwen официально выпустили Qwen3-TTS и полностью открыли всю линейку моделей - Base / CustomVoice / VoiceDesign. Что внутри: - 5 моделей (0.6B и 1.8B классы) - Free-form Voice Design - генерация/редаквтирование голоса по описанию - Voice Cloning - клонирование голоса - 10 языков - 12Hz tokenizer - сильная компрессия аудио без сильной потери качества - полная поддержка fine-tuning - заявляют SOTA качество на ряде метрик Раньше лучшие генераторы были в закрытых API, а теперь появляется полноценный open-source стек TTS, где можно: - обучать под домен, - делать кастомные голоса, - и не зависеть от провайдера. ▪GitHub: https://github.com/QwenLM/Qwen3-TTS ▪Hugging Face: https://huggingface.co/collections/Qwen/qwen3-tts ▪Демо (HF): https://huggingface.co/spaces/Qwen/Qwen3-TTS ▪Блог: https://qwen.ai/blog?id=qwen3tts-0115 ▪Paper: https://github.com/QwenLM/Qwen3-TTS/blob/main/assets/Qwen3_TTS.pdf @ai_machinelearning_big_data #AI#TTS#Qwen#OpenSource#SpeechAI

32,900 views

Опубликован 23 дек.

🗣 Новая линейка Qwen3-TTS: VoiceDesign и VoiceClone Qwen представили новое поколение TTS-моделей, которые выводят управление голосом и voice cloning на новый уровень. Быстрее, выразительнее и гибче, чем раньше. VoiceDesign-VD-Flash Модель для полного конструирования голоса с нуля. Что умеет: - полный контроль речи через обычные текстовые инструкции - управление тоном, ритмом, эмоциями и персоной - никаких готовых голосов - ты создаешь уникальную вокальную идентичность - превосходит GPT-4o-mini-tts и Gemini-2.5-pro в role-play бенчмарках Подходит для: - игровых персонажей - виртуальных ассистентов - сторителлинга и диалогов - AI-персонажей с характером VoiceClone-VC-Flash Фокус на быстрое и качественное клонирование голоса. Ключевые возможности: - клонирование любого голоса всего по 3 секундам аудио - генерация речи на 10 языках (китайский, английский, японский, испанский и другие) - на 15% ниже WER по сравнению с ElevenLabs и GPT-4o-Audio в мультиязычных тестах - контекстно-зависимая интонация и ритм для более естественного звучания https://x.com/Alibaba_Qwen/status/2003445076257656880 Попробовать: •Qwen Chat:http://chat.qwen.ai •Блог: https://qwen.ai/blog?id=qwen3-tts-vc-voicedesign • VoiceDesign: http://hf.co/spaces/Qwen/Qwen3-TTS-Voice-Design http://modelscope.cn/studios/Qwen/Qwen3-TTS-Voice-Design • VoiceClone: http://hf.co/spaces/Qwen/Qwen-TTS-Clone-Demo http://modelscope.cn/studios/Qwen/Qwen-TTS-Clone-Demo @ai_machinelearning_big_data #AI#TTS#voicecloning

30,800 views