Find similar content

Source channel @githubtrending · Post #15521 · Feb 25

#rust#ai_gateway#ai_gateway_support#envoy#envoyproxy#gateway#generative_ai#llm_gateway#llm_inference#llm_proxy#llm_routing#llmops#llms#openai#prompt#proxy#proxy_server#routing Plano is an AI-native proxy server that handles key tasks for agentic apps like routing between agents, smart LLM model selection, safety guardrails, and automatic traces for observability. Define agents in simple YAML, write basic HTTP code in any language, and start Plano to run multi-agent systems without custom plumbing or framework lock-in. You benefit by building and shipping reliable agents to production much faster, focusing on core logic while gaining safety, low latency, and easy scaling. https://github.com/katanemo/plano

Hashtags

#rust #ai_gateway #ai_gateway_support #envoy #envoyproxy #gateway #generative_ai #llm_gateway #llm_inference #llm_proxy #llm_routing #llmops #llms #openai #prompt #proxy #proxy_server #routing

Results

4 similar posts found

Search: #gguf

当前筛选 #gguf清除筛选

Machinelearning

@ai_machinelearning_big_data · Post #8348 · 08/23/2025, 03:51 PM

Find similar View

🐋 DeepSeek-V3.1 теперь можно запускать локально Оригинальная модель весила 715GB, но её удалось уменьшить до 170GBRAM (−80%) с помощью новой техники квантовки Dynamic 1-bit GGUF. ⚡ Огромная экономия памяти 👉 Подробный гайд: https://docs.unsloth.ai/basics/deepseek-v3.1 👉 GGUF-модель: https://huggingface.co/unsloth/DeepSeek-V3.1-GGUF Теперь топовую DeepSeek реально запустить даже на локальной машине, а не только в дата-центре 🚀 @ai_machinelearning_big_data #DeepSeek#GGUF

Hashtags

#deepseek #gguf

Machinelearning

@ai_machinelearning_big_data · Post #8238 · 08/08/2025, 11:34 AM

Find similar View

⚡️GGUF-версии GPT-OSS от Unsloth. Unsloth конвертировали обе GPT-OSS (20B и 120B) и исправили ошибки, чтобы повысить качество инференса. 🟡Оптимальный сетап: 🟢20B работает со скоростью более 10 токенов/с при полной точности на 14 ГБ оперативной памяти. 🟢120B с полной точностью будет давать >40 токенов/с на примерно 64 ГБ ОЗУ. Минимальных требований для запуска моделей нет, запуститься можно даже если у вас всего 6 ГБ и только CPU, но инференс будет медленнее. GPU не требуется , особенно для модели 20B, но его наличие значительно увеличивает скорость вывода (~80 токенов/с). С чем-то вроде H100 можно получить пропускную способность 140 токенов/с, и это значительно быстрее, чем у OpenAI в ChatGPT. Модели можно запустить через llama.cpp, LM Studio или Open WebUI. Если модель 120B слишком медленная, попробуйте версию 20B - она очень быстрая и работает не хуже o3-mini. Помимо моделей формата GGUF c полной точностью, Unsloth сделали версии с 4-bit и 16-bit точностью. 4-бинтый квант, кстати, можно файнтюнить на 24 ГБ VRAM. 📌 Подробная пошаговая инструкция по локальному запуску и файнтюну - в документации Unsloth. 🟡Набор моделей 🟡Документация @ai_machinelearning_big_data #AI#ML#GPTOSS#GGUF#Unsloth

Hashtags

#ai #ml #gptoss #gguf #unsloth

Crypto M - Crypto News

@CryptoM · Post #65303 · 04/12/2026, 05:19 PM

Find similar View

🚀 AI TRENDS | New Local Model Qwopus3.5-27B-v3 Released with High HumanEval Score Developer Jackrong has introduced Qwopus3.5-27B-v3, a local model designed to operate on a single consumer GPU. According to NS3.AI, this model boasts an impressive 95.73% score on HumanEval. The Qwopus3.5-27B-v3 is distilled from Claude Opus 4.6-style reasoning and is available in GGUF format for use with LM Studio or llama.cpp. #AI#Qwopus3.5 #HumanEval#Jackrong#ClaudeOpus#GGUF#LMStudio#llama_cpp#AITrends

Hashtags

#ai #qwopus3 #humaneval #jackrong #claudeopus #gguf #lmstudio #llama_cpp #aitrends

是芙莉莲

@ireallyhatetheworld · Post #1459 · 03/16/2026, 01:23 PM

Find similar View

Qwen3.5-9B-Claude-4.6-Opus-Uncensored-Distilled-GGUF: 面向本地部署的轻量级创意与推理模型 🔞可用于本地涩涩等场景 • 基于 Qwen 3.5 9B，并融入 Claude Opus 4.6 蒸馏思路，主打更强的创意表达、对话表现与角色扮演场景 • 提供 GGUF 与低显存友好的 Q4_K_M 量化版本，作者反馈在 RTX 3060 12 GB 上可达约 38 tok/s，适合本地聊天、游戏 NPC 与 Home Lab 部署 • 默认关闭 thinking 以提升通用聊天体验，需要时可在 LM Studio 中手动开启；模型采用 Apache 2.0 许可证，便于社区测试与二次集成 https://www.reddit.com/r/LocalLLaMA/comments/1runlpf/qwen359bclaude46opusuncensoreddistilledgguf #AI#Uncensored#本地大模型#模型蒸馏#GGUF#Qwen#Claude#LMStudio#量化模型#低显存部署#角色扮演#LocalLLaMA

Hashtags

#ai #uncensored #本地大模型 #模型蒸馏 #gguf #qwen #claude #lmstudio #量化模型 #低显存部署 #角色扮演 #localllama