RedditNVFP4 Support Coming to llama.cpp for Local InferenceGitHub·high signalXBlueskyLinkedInCopy linkTrue NVFP4 support arriving via GitHub PR 19769. Unlocks larger MoE models on 48GB or less memory at native FP4.SourceSource pageGitHub↳ Follow the threadShared entity / Actor rolellama.cpp 0.4.0 adds lazy tensor reading and a quantizer RAM cap so big models stop peaking host memory on loadGitHubShared entity / Stack layerBase-3 packing for ternary GGUFs cuts weight VRAM about 22% with no precision lossr/LocalLLaMAStack layer / Threat patternCrewAI 1.15.19 downgrades its own telemetry from core count to a coarse machine-size bandGitHubPolicy dependency / Stack layercloudflare/vibesdk has 1,253 forks against 5,346 stars, a 4.3:1 ratio that marks it as a template rather than a dependencyGitHubStack layer / ContrastLoopX runs two interleaved release trains, a stable control plane and a DSH plugin beta, hours apartGitHub TrendingPolicy dependency / Threat patternCopilot CLI now waits for managed settings before letting any MCP server startGitHubPolicy dependency / Stack layerbrowser-use 0.13.10 exact-pins every dependency and stops reporting unknown MCP tool calls as successesGitHubStack layer / Follow-up threadA 90M model now runs on a 2004 Sony PSP at 0.5 tokens per second via a custom 4-bit formatGitHub (via r/LocalLLaMA, 1,061 upvotes)