News-Tracker

Søgning

AI & LLM · daglig briefing


3 research-rapport(er) for »vision«

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Which Open Model Wins in Coding, Translation, and Vision? | by Mehul Gupta | Data Science in Your Pocket | Medium](https://medium.com/data-science-in …

fredag 7. august 2026 · research

Qwen 3.8 27b

… Modellen beskrives som en kausal sprogmodel med visionsencoder, 27B parametre, 64 lag, 262.144 tokens kontekstlængde (udvidelig til 1.010.000), og den er …

mandag 3. august 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… april 2026) er Qwen3.6-27B en "dense 27B model with vision capability" med 64 lag, 262.144 tokens kontekstlængde (udvidelig til 1. ## Ubekræftet …

torsdag 30. juli 2026 · research

18 briefing-resultat(er) for »vision«

Gammel GPU kan speede mmproj op til 10x med llama.cpp

Ét flag – `--mmdev CUDA1` – kan lade en sekundær, langsom GPU håndtere vision mmproj og frigøre VRAM til inferens. Praktisk hack til lokal multi-GPU.

lørdag 12. september 2026 · Værktøjer & produkter llama.cppmmprojgpu-offloadinglocal-llm

DeepSeek V4.1 Flash er 748B parametre – ikke 284B

Reddit-undersøgelse af safetensors-filerne afslører sande paramettertal: 552B i basismodellen, 748B med engram og vision-encoder. Kræver markant mere hardware end antaget.

fredag 11. september 2026 · Nye modeller deepseek-v41-flashmodel-size748bopen-weights

Opfølgning: DeepSeek V4 Flash vs GLM 5.3 Flash på to GX10

Opfølgning på [briefingen 30. august](/archive/2026-08-30). Bruger rapporterer GLM vinder på skrivekvalitet og vision, DeepSeek på tokenhastighed.

torsdag 3. september 2026 · Forskning & arkitektur deepseek-v4glm-5.3dgx-sparkcomparison

Opfølgning: Import AI 471: Hugging Face bekymrer, DeepSeek V4 Flash Vision udkommer

… Samtidig er DeepSeek V4 Flash Vision med billedanalyse ude. Læs baggrunden i [briefingen 22. august](/archive/2026-08-22).

tirsdag 1. september 2026 · 🗣️ Stemmer hugging-faceai-safetydeepseekagents

Vision-støtte gør Qwen 3.8 27B til en bedre kodeassistent

Brugere på LocalLLaMA rapporterer, at vision-versionen af Qwen 3.8 27B automatisk tager screenshots for at verificere kode, hvilket reducerer stille fejl. Kører …

tirsdag 1. september 2026 · Værktøjer & produkter qwen-3.8visioncodingvlm

Opfølgning: Qwen 3.8 27B får bruger til at nuke OpenWebUI – og lykkes

… lokalt efter at have nulstillet sin docker-konfiguration – nu styrer modellen hans HomeAssistant-server via vision. Se [briefingen 18. august](/archive/2026-08-18).

mandag 24. august 2026 · Værktøjer & produkter qwen3.8-27bhome-assistantlocal-llmcoding

450M VLM finetunet på 50.000 browserscreenshots – fra 1% til 44%

En bruger på r/LocalLLaMA deler resultater af at fine-tune en 450M vision-language-model på 50.000 browserscreenshots, hvilket løftede performance fra …

mandag 24. august 2026 · Forskning & arkitektur fine-tuningvlmbrowser-screenshots450m

DeepSeek Harness v0.1.1 ude – understøtter nu vision og billedanalyse

Den nye adapter til DeepSeek-V4-Flash-Vision-Exp gør det muligt at sende billeder i /goal og /plan, samt vedhæfte filer via MCP …

lørdag 22. august 2026 · Værktøjer & produkter deepseek-harnessdeepseek-v4-flash-visionmultimodal

Strix Halo-guide: Qwen3.8-27B i Q8 med 256K kontekst og vision

En detaljeret guide til at opsætte et LLM API-endpoint på AMD Strix Halo med opskrifter til kvalitet, balance og hastighed – bygget med pi …

lørdag 22. august 2026 · Værktøjer & produkter strix-haloqwen3.8-27bllama.cppoptimization-guide

PI Agent overgår OpenCode med Qwen3.8 27B – færre tokens, færre fejl

… direkte sammenligning brugte PI Agent mindre kontekst, frøs ikke og komprimerede senere end OpenCode. Vision-modul anbefales. [Se tidligere dækning](/archive/2026-08-21)

lørdag 22. august 2026 · Nye modeller qwen3.8-27bai-agentsopencodeagent-comparison

Opfølgning: Liquid AI's 3B VL-model læser skærme og kalder værktøjer lokalt

LFM2.5-VL-3B klarer 228 tok/s på Apple M5 Max og forbedrer ToolSandbox fra 26,4 til 59,5. Modellen er open …

fredag 14. august 2026 · Nye modeller liquid-ailfm2.5-vl-3bvision-languageon-device

Opfølgning: DeepSeek V4 Flash fik basic vision via 40M connector trænet på 100K eksempler

En udvikler gav DeepSeek V4 Flash basic vision ved at fryse modellen og træne en 40M connector mellem MoonViT-encoder og sprogmodellen på 100K …

tirsdag 11. august 2026 · Nye modeller deepseek-v4-flashvisionmoonvitconnector

Nvidias Nemotron Omni kører nu i ren MLX på Mac

En udvikler har porteret vision- og lydtårnene til MLX, så den åbne multimodale model kører lokalt med op til 152 tokens/s på M5 …

fredag 7. august 2026 · Nye modeller nemotron-omnimlxmultimodalopen-weights

Minimax M3 og MSA understøttet i llama.cpp – alle GGUFs skal regenereres

… Minimax M3 med Multi-Scale Attention og vision-support er blevet mergeret ind, hvilket lover markant bedre lokal inferens.

mandag 27. juli 2026 · Nye modeller llama.cppminimax-m3ggufmsa

ASCIITermDraw Bench tester VLM'ers evne til at tegne i ASCII

Ny benchmark med 80 opgaver måler, om vision-sprogmodeller kan generere og redigere ASCII-diagrammer præcist. Opgaver spænder fra netværkstopologi til softwarearkitektur.

søndag 19. juli 2026 · Forskning & arkitektur ascii-term-drawvlmbenchmarkevaluation

Synsmodel trænes til at se som en menneskelig annotator – og afsløres når den lyver

Microsofts pipeline udtrækker struktureret metadata fra visuelle aktiver, begrænser output til foruddefinerede værdier og bruger en ground-truth-evaluering til at måle kvalitet.

lørdag 18. juli 2026 · Forskning & arkitektur multimodal-llmvision-modelhallucinationmicrosoft

reCamera Pro kombinerer computer vision med LLM/VLM på enheden

Seeed Studios nye AI-kamera bruger Rockchip RV1126B med 3 TOPS NPU til on-device vision, men understøtter også LLM, VLM, STT og TTS …

fredag 17. juli 2026 · Værktøjer & produkter recamera-proedge-aicomputer-visionrockchip