TGTGInsighttelegram intelligenceLIVE / telegram public index
← () => "翠楼屋"

TGINSIGHT SIMILAR POSTS

查找相似内容

Source channel @lambdaexpression · Post #310 · 2月13日

by iPhone13 Pro #摄影

Hashtags

Results

找到 4 条相似帖子

搜索 #gguf

当前筛选 #gguf清除筛选
Machinelearning

@ai_machinelearning_big_data · Post #8348 · 2025/08/23 15:51

🐋 DeepSeek-V3.1 теперь можно запускать локально Оригинальная модель весила 715GB, но её удалось уменьшить до 170GBRAM (−80%) с помощью новой техники квантовки Dynamic 1-bit GGUF. ⚡ Огромная экономия памяти 👉 Подробный гайд: https://docs.unsloth.ai/basics/deepseek-v3.1 👉 GGUF-модель: https://huggingface.co/unsloth/DeepSeek-V3.1-GGUF Теперь топовую DeepSeek реально запустить даже на локальной машине, а не только в дата-центре 🚀 @ai_machinelearning_big_data #DeepSeek#GGUF

Machinelearning

@ai_machinelearning_big_data · Post #8238 · 2025/08/08 11:34

⚡️GGUF-версии GPT-OSS от Unsloth. Unsloth конвертировали обе GPT-OSS (20B и 120B) и исправили ошибки, чтобы повысить качество инференса. 🟡Оптимальный сетап: 🟢20B работает со скоростью более 10 токенов/с при полной точности на 14 ГБ оперативной памяти. 🟢120B с полной точностью будет давать >40 токенов/с на примерно 64 ГБ ОЗУ. Минимальных требований для запуска моделей нет, запуститься можно даже если у вас всего 6 ГБ и только CPU, но инференс будет медленнее. GPU не требуется , особенно для модели 20B, но его наличие значительно увеличивает скорость вывода (~80 токенов/с). С чем-то вроде H100 можно получить пропускную способность 140 токенов/с, и это значительно быстрее, чем у OpenAI в ChatGPT. Модели можно запустить через llama.cpp, LM Studio или Open WebUI. Если модель 120B слишком медленная, попробуйте версию 20B - она очень быстрая и работает не хуже o3-mini. Помимо моделей формата GGUF c полной точностью, Unsloth сделали версии с 4-bit и 16-bit точностью. 4-бинтый квант, кстати, можно файнтюнить на 24 ГБ VRAM. 📌 Подробная пошаговая инструкция по локальному запуску и файнтюну - в документации Unsloth. 🟡Набор моделей 🟡Документация @ai_machinelearning_big_data #AI#ML#GPTOSS#GGUF#Unsloth

Crypto M - Crypto News

@CryptoM · Post #65303 · 2026/04/12 17:19

🚀 AI TRENDS | New Local Model Qwopus3.5-27B-v3 Released with High HumanEval Score Developer Jackrong has introduced Qwopus3.5-27B-v3, a local model designed to operate on a single consumer GPU. According to NS3.AI, this model boasts an impressive 95.73% score on HumanEval. The Qwopus3.5-27B-v3 is distilled from Claude Opus 4.6-style reasoning and is available in GGUF format for use with LM Studio or llama.cpp. #AI#Qwopus3.5 #HumanEval#Jackrong#ClaudeOpus#GGUF#LMStudio#llama_cpp#AITrends

是芙莉莲

@ireallyhatetheworld · Post #1459 · 2026/03/16 13:23

Qwen3.5-9B-Claude-4.6-Opus-Uncensored-Distilled-GGUF: 面向本地部署的轻量级创意与推理模型 🔞可用于本地涩涩等场景 • 基于 Qwen 3.5 9B,并融入 Claude Opus 4.6 蒸馏思路,主打更强的创意表达、对话表现与角色扮演场景 • 提供 GGUF 与低显存友好的 Q4_K_M 量化版本,作者反馈在 RTX 3060 12 GB 上可达约 38 tok/s,适合本地聊天、游戏 NPC 与 Home Lab 部署 • 默认关闭 thinking 以提升通用聊天体验,需要时可在 LM Studio 中手动开启;模型采用 Apache 2.0 许可证,便于社区测试与二次集成 https://www.reddit.com/r/LocalLLaMA/comments/1runlpf/qwen359bclaude46opusuncensoreddistilledgguf #AI#Uncensored#本地大模型#模型蒸馏#GGUF#Qwen#Claude#LMStudio#量化模型#低显存部署#角色扮演#LocalLLaMA