Søgning
3 research-rapport(er) for »vision-model«
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Which Open Model Wins in Coding, Translation, and Vision? | by Mehul Gupta | Data Science in Your Pocket | Medium](https://medium.com/data-science-in …
Qwen 3.8 27b
… Modellen beskrives som en kausal sprogmodel med visionsencoder, 27B parametre, 64 lag, 262.144 tokens kontekstlængde (udvidelig til 1.010.000), og den er …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… april 2026) er Qwen3.6-27B en "dense 27B model with vision capability" med 64 lag, 262.144 tokens kontekstlængde (udvidelig til 1. ## Ubekræftet …
8 briefing-resultat(er) for »vision-model«
DeepSeek V4.1 Flash er 748B parametre – ikke 284B
Reddit-undersøgelse af safetensors-filerne afslører sande paramettertal: 552B i basismodellen, 748B med engram og vision-encoder. Kræver markant mere hardware end antaget.
Opfølgning: Qwen 3.8 27B får bruger til at nuke OpenWebUI – og lykkes
… lokalt efter at have nulstillet sin docker-konfiguration – nu styrer modellen hans HomeAssistant-server via vision. Se [briefingen 18. august](/archive/2026-08-18).
450M VLM finetunet på 50.000 browserscreenshots – fra 1% til 44%
En bruger på r/LocalLLaMA deler resultater af at fine-tune en 450M vision-language-model på 50.000 browserscreenshots, hvilket løftede performance fra …
Opfølgning: Liquid AI's 3B VL-model læser skærme og kalder værktøjer lokalt
… M5 Max og forbedrer ToolSandbox fra 26,4 til 59,5. Modellen er open-weight og designet til on-device-brug. Se [briefingen 7 …
Opfølgning: DeepSeek V4 Flash fik basic vision via 40M connector trænet på 100K eksempler
En udvikler gav DeepSeek V4 Flash basic vision ved at fryse modellen og træne en 40M connector mellem MoonViT-encoder og sprogmodellen på 100K …
Nvidias Nemotron Omni kører nu i ren MLX på Mac
En udvikler har porteret vision- og lydtårnene til MLX, så den åbne multimodale model kører lokalt med op til 152 tokens/s på M5 …
Synsmodel trænes til at se som en menneskelig annotator – og afsløres når den lyver
Microsofts pipeline udtrækker struktureret metadata fra visuelle aktiver, begrænser output til foruddefinerede værdier og bruger en ground-truth-evaluering til at måle kvalitet.