Søgning
2 research-rapport(er) for »multimodal«
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Gemma 4-modellerne fra Google DeepMind, udgivet april 2026, præsenteres i [3] og [4] som multimodal med tekst-, billede- og lydstøtte (på de mindre …
Qwen 3.8 27b
… Qwen3.6-27B er en multimodal model, der accepterer tekst, billeder og video [2], og den er udgivet under Apache 2.0-licensen [2 …
11 briefing-resultat(er) for »multimodal«
Opfølgning: 14 nye papirer kortlægger jailbreak-landskabet – fra multi-turn til forsvar
En række nye forskningsartikler systematiserer multi-turn jailbreak-angreb mod multimodale LLM'er og præsenterer forsvar som TRYLOCK og Attention Slipping. Angrebene udnytter, at …
Sjov model med 20 "sanser" – men den virker
… Eksperimentet illustrerer, hvor hurtigt open-source-fællesskabet kan lege med ekstrem multimodalitet.
Opfølgning: Zhipu afslører Ox Alpha som GLM-5.3-Flash og udgiver vægte
… aktive) – den første native multimodale model i GLM-5-serien. Vægtene er nu frit tilgængelige. [briefingen 14. august](/archive/2026-08-14)
Opfølgning: Gemini Omni 1.1 Flash giver udviklere mere kontrol
Google har opdateret Gemini Omni Flash med bedre styring af multimodal inferens. Opdateringen giver udviklere finere kontrol over modellens adfærd. [briefingen 20. august](/archive …
Opfølgning: Alibaba udgiver Qwen3.8-Flash-Next som forhåndsvisning af Qwen4-arkitekturen
Den nye 125B MoE-model med 6B aktive parametre er multimodal og giver et tidligt indblik i Qwen4. Modellen bygger videre på Qwen3.8 …
DeepSeek Harness v0.1.1 ude – understøtter nu vision og billedanalyse
Den nye adapter til DeepSeek-V4-Flash-Vision-Exp gør det muligt at sende billeder i /goal og /plan, samt vedhæfte filer via MCP …
dots3-note preview: første open-weight model i familien – 280B parametre
En MoE-model med 16B aktive parametre, 512K kontekst og forståelse af tekst, billeder, video og lyd. Pull request indsendt til llama.cpp.
Debat: Google bør udgive 120B multimodalt Gemma for at presse OpenAI og Anthropic
Debatten peger på, at vestlige virksomheder ikke vil bruge kinesiske modeller – et åbent, næsten-frontier Gemma ville presse OpenAI og Anthropic før deres børsnoteringer …
Nvidias Nemotron Omni kører nu i ren MLX på Mac
En udvikler har porteret vision- og lydtårnene til MLX, så den åbne multimodale model kører lokalt med op til 152 tokens/s på M5 …
Synsmodel trænes til at se som en menneskelig annotator – og afsløres når den lyver
Microsofts pipeline udtrækker struktureret metadata fra visuelle aktiver, begrænser output til foruddefinerede værdier og bruger en ground-truth-evaluering til at måle kvalitet.
Thinking Machines Lab frigiver Inkling open-weights model
Mira Muratis nye laboratorium lancerer Inkling med 975B totale parametre (41B aktive) som Apache-2.0 licenseret multimodal model. Modellen er ikke frontier-niveau …