Søgning
3 research-rapport(er) for »vision«
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Which Open Model Wins in Coding, Translation, and Vision? | by Mehul Gupta | Data Science in Your Pocket | Medium](https://medium.com/data-science-in …
Qwen 3.8 27b
… Modellen beskrives som en kausal sprogmodel med visionsencoder, 27B parametre, 64 lag, 262.144 tokens kontekstlængde (udvidelig til 1.010.000), og den er …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… april 2026) er Qwen3.6-27B en "dense 27B model with vision capability" med 64 lag, 262.144 tokens kontekstlængde (udvidelig til 1. ## Ubekræftet …
18 briefing-resultat(er) for »vision«
Gammel GPU kan speede mmproj op til 10x med llama.cpp
Ét flag – `--mmdev CUDA1` – kan lade en sekundær, langsom GPU håndtere vision mmproj og frigøre VRAM til inferens. Praktisk hack til lokal multi-GPU.
DeepSeek V4.1 Flash er 748B parametre – ikke 284B
Reddit-undersøgelse af safetensors-filerne afslører sande paramettertal: 552B i basismodellen, 748B med engram og vision-encoder. Kræver markant mere hardware end antaget.
Opfølgning: DeepSeek V4 Flash vs GLM 5.3 Flash på to GX10
Opfølgning på [briefingen 30. august](/archive/2026-08-30). Bruger rapporterer GLM vinder på skrivekvalitet og vision, DeepSeek på tokenhastighed.
Opfølgning: Import AI 471: Hugging Face bekymrer, DeepSeek V4 Flash Vision udkommer
… Samtidig er DeepSeek V4 Flash Vision med billedanalyse ude. Læs baggrunden i [briefingen 22. august](/archive/2026-08-22).
Vision-støtte gør Qwen 3.8 27B til en bedre kodeassistent
Brugere på LocalLLaMA rapporterer, at vision-versionen af Qwen 3.8 27B automatisk tager screenshots for at verificere kode, hvilket reducerer stille fejl. Kører …
Opfølgning: Qwen 3.8 27B får bruger til at nuke OpenWebUI – og lykkes
… lokalt efter at have nulstillet sin docker-konfiguration – nu styrer modellen hans HomeAssistant-server via vision. Se [briefingen 18. august](/archive/2026-08-18).
450M VLM finetunet på 50.000 browserscreenshots – fra 1% til 44%
En bruger på r/LocalLLaMA deler resultater af at fine-tune en 450M vision-language-model på 50.000 browserscreenshots, hvilket løftede performance fra …
DeepSeek Harness v0.1.1 ude – understøtter nu vision og billedanalyse
Den nye adapter til DeepSeek-V4-Flash-Vision-Exp gør det muligt at sende billeder i /goal og /plan, samt vedhæfte filer via MCP …
Strix Halo-guide: Qwen3.8-27B i Q8 med 256K kontekst og vision
En detaljeret guide til at opsætte et LLM API-endpoint på AMD Strix Halo med opskrifter til kvalitet, balance og hastighed – bygget med pi …
PI Agent overgår OpenCode med Qwen3.8 27B – færre tokens, færre fejl
… direkte sammenligning brugte PI Agent mindre kontekst, frøs ikke og komprimerede senere end OpenCode. Vision-modul anbefales. [Se tidligere dækning](/archive/2026-08-21)
Opfølgning: Liquid AI's 3B VL-model læser skærme og kalder værktøjer lokalt
LFM2.5-VL-3B klarer 228 tok/s på Apple M5 Max og forbedrer ToolSandbox fra 26,4 til 59,5. Modellen er open …
Opfølgning: DeepSeek V4 Flash fik basic vision via 40M connector trænet på 100K eksempler
En udvikler gav DeepSeek V4 Flash basic vision ved at fryse modellen og træne en 40M connector mellem MoonViT-encoder og sprogmodellen på 100K …
Nvidias Nemotron Omni kører nu i ren MLX på Mac
En udvikler har porteret vision- og lydtårnene til MLX, så den åbne multimodale model kører lokalt med op til 152 tokens/s på M5 …
Minimax M3 og MSA understøttet i llama.cpp – alle GGUFs skal regenereres
… Minimax M3 med Multi-Scale Attention og vision-support er blevet mergeret ind, hvilket lover markant bedre lokal inferens.
ASCIITermDraw Bench tester VLM'ers evne til at tegne i ASCII
Ny benchmark med 80 opgaver måler, om vision-sprogmodeller kan generere og redigere ASCII-diagrammer præcist. Opgaver spænder fra netværkstopologi til softwarearkitektur.
Synsmodel trænes til at se som en menneskelig annotator – og afsløres når den lyver
Microsofts pipeline udtrækker struktureret metadata fra visuelle aktiver, begrænser output til foruddefinerede værdier og bruger en ground-truth-evaluering til at måle kvalitet.
reCamera Pro kombinerer computer vision med LLM/VLM på enheden
Seeed Studios nye AI-kamera bruger Rockchip RV1126B med 3 TOPS NPU til on-device vision, men understøtter også LLM, VLM, STT og TTS …