News-Tracker

Søgning

AI & LLM · daglig briefing


3 research-rapport(er) for »vision-model«

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Which Open Model Wins in Coding, Translation, and Vision? | by Mehul Gupta | Data Science in Your Pocket | Medium](https://medium.com/data-science-in …

fredag 7. august 2026 · research

Qwen 3.8 27b

Modellen beskrives som en kausal sprogmodel med visionsencoder, 27B parametre, 64 lag, 262.144 tokens kontekstlængde (udvidelig til 1.010.000), og den er …

mandag 3. august 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… april 2026) er Qwen3.6-27B en "dense 27B model with vision capability" med 64 lag, 262.144 tokens kontekstlængde (udvidelig til 1. ## Ubekræftet …

torsdag 30. juli 2026 · research

8 briefing-resultat(er) for »vision-model«

DeepSeek V4.1 Flash er 748B parametre – ikke 284B

Reddit-undersøgelse af safetensors-filerne afslører sande paramettertal: 552B i basismodellen, 748B med engram og vision-encoder. Kræver markant mere hardware end antaget.

fredag 11. september 2026 · Nye modeller deepseek-v41-flashmodel-size748bopen-weights

Opfølgning: Qwen 3.8 27B får bruger til at nuke OpenWebUI – og lykkes

… lokalt efter at have nulstillet sin docker-konfiguration – nu styrer modellen hans HomeAssistant-server via vision. Se [briefingen 18. august](/archive/2026-08-18).

mandag 24. august 2026 · Værktøjer & produkter qwen3.8-27bhome-assistantlocal-llmcoding

450M VLM finetunet på 50.000 browserscreenshots – fra 1% til 44%

En bruger på r/LocalLLaMA deler resultater af at fine-tune en 450M vision-language-model på 50.000 browserscreenshots, hvilket løftede performance fra …

mandag 24. august 2026 · Forskning & arkitektur fine-tuningvlmbrowser-screenshots450m

Opfølgning: Liquid AI's 3B VL-model læser skærme og kalder værktøjer lokalt

… M5 Max og forbedrer ToolSandbox fra 26,4 til 59,5. Modellen er open-weight og designet til on-device-brug. Se [briefingen 7 …

fredag 14. august 2026 · Nye modeller liquid-ailfm2.5-vl-3bvision-languageon-device

Opfølgning: DeepSeek V4 Flash fik basic vision via 40M connector trænet på 100K eksempler

En udvikler gav DeepSeek V4 Flash basic vision ved at fryse modellen og træne en 40M connector mellem MoonViT-encoder og sprogmodellen på 100K …

tirsdag 11. august 2026 · Nye modeller deepseek-v4-flashvisionmoonvitconnector

Nvidias Nemotron Omni kører nu i ren MLX på Mac

En udvikler har porteret vision- og lydtårnene til MLX, så den åbne multimodale model kører lokalt med op til 152 tokens/s på M5 …

fredag 7. august 2026 · Nye modeller nemotron-omnimlxmultimodalopen-weights

Synsmodel trænes til at se som en menneskelig annotator – og afsløres når den lyver

Microsofts pipeline udtrækker struktureret metadata fra visuelle aktiver, begrænser output til foruddefinerede værdier og bruger en ground-truth-evaluering til at måle kvalitet.

lørdag 18. juli 2026 · Forskning & arkitektur multimodal-llmvision-modelhallucinationmicrosoft