Søgning
5 research-rapport(er) for »memory«
hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting
## Hvad kilderne siger Flere kilder beskriver 120B-modeller (modeller med omkring 120 milliarder parametre) som velegnede til lokal hosting med 128GB hukommelse, primært på …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… at måle, at Qwen 3.6 27B kræver "only slightly less memory" end Gemma 4 12B trods den store parameterforskel, med begge modeller testet …
hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting
## Hvad der skete Flere kilder rapporterer om Alibabas lancering og opdatering af deres open‑source sprogmodel‑familie Qwen (通义千问). Den 9. maj 2024 udgav …
Mac Studio M5, rygter, Pris, Specs og release dato
… 5]: "the delays are likely the result of a severe global memory chip shortage driven by surging demand from companies building AI servers that …
Mac Studio M5 hvornår kommer den? båndbredde på hukommelsen? og hvad med rygtet omkring at M6 springes over og de går til M7 i stedet og går efter højere memory båndbredde?
… M6 Memory Bandwidth Could See a Generational Leap](https://www.reddit.com/r/MacStudio/comments/1rtd36x/m6_memory_bandwidth_could_see_a_generational_leap …
21 briefing-resultat(er) for »memory«
Opfølgning: Microns "memory wall" – compute vokser 3x, HBM kun 2x hvert andet år
… Løsninger som "memory beside compute" og indlejret inferens i hukommelsen (Samsungs LPDDR5X giver 3x tokens/sekund) er under udvikling. Se [briefingen 7. september](/archive …
Ny oversigt samler LLM-agenters hukommelsesarkitekturer
Surveyen kortlægger modulære hukommelsesstrategier for langtidshorisonter, herunder et neuro-symbolsk dobbelt-hukommelsesframework.
OKF Agent Memory: git-baseret hukommelse til kodningsagenter
Nyt open source-projekt giver AI-kodningsagenter vedvarende, git-native hukommelse. Diskuteret på Hacker News.
Opfølgning: Formel for maksimal tokens/sekund ud fra VRAM-båndbredde
Decode-hastigheden kan estimeres som båndbredde divideret med vægt plus KV-cache; eksempel: 637 GB/s over 16,8 GB giver teoretisk 38 tok …
Opfølgning: llama.cpp ændrer standard for --lazy-mode – giver hastighedsstraf
Fra b10726 lægges store tabeller som Qwen 3.8 Flash Nexts PLE-embedding ikke længere i RAM som standard, hvilket gav 50% prefill-straf …
Google WikiSkill giver AI-agenter en hukommelse, der lærer af fejl
Inspireret af Andrej Karpathys "LLM Wiki" giver WikiSkill agenter en vedvarende wiki, der opdateres med erfaringer, så en 9B-model kan overgå en 27B …
InjecMEM: Nyt angreb forgifter LLM-agenters hukommelse med ét prompt
Forskere viser, at én enkelt interaktion kan plante skjulte instruktioner i agents memory-system, som styrer fremtidige svar. [briefingen 21. august](/archive/2026-08 …
Qwen3.8-Flash-Next: 125B MoE med n-gram-tabel kan blive local-friendly
Arkitekturen har ~6B aktive parametre og en sparsom n-gram-tabel på 51B, hvilket gør 4-bit kvantisering på ~82 GB mulig – ideel til …
Apple lancerer Mac mini med M6-chip og 4x hurtigere AI-ydeevne
… Mac mini starter ved $899 med 16 GB unified memory.
Xiaomi AI Cube: 1,2 TB/s hukommelsesbåndbredde i prototype
Xiaomi annoncerer AI Cube med tre chips – Xuanjie O3, O100 og D100 – hvor O100 leverer imponerende 1,22 TB/s båndbredde, muligvis SRAM.
The All Spark: Fra 16 til 36 DGX Sparks i ét homelab-rack
En bruger udvider sin 16x DGX Spark-klynge til 36 enheder (4,6 TB unified memory) og splitter den i dedikerede inferensmoduler. 16 noder …
Opfølgning: Hvilken harness til lange autonome opgaver?
En bruger efterspørger den bedste harness til lange autonome opgaver med auto-kompaktion og hukommelsessystem – inspireret af posts om Qwen 3.8 27B, der …
12 spørgsmål og svar om utilsigtede agenthandlinger
En serie artikler dækker, hvordan AI-agenter pludselig afviger fra missionen, løber løbsk eller får forgiftet hukommelsen – og hvordan man stopper det.
Intel Optane som tredje lagerlag til MoE-modeller diskuteres
En bruger spekulerer i, om udgået Intel Optane-teknologi kan bruges som en tredje hukommelseslag til nestede MoE-modeller mellem RAM og NVMe.
Tencent open-sourcerer agenthukommelse med versionering og adgangsstyring
TencentDB Agent Memory v2.0 er en team-level memory hub, der strukturerer samtaler, kode og dokumenter i fire genbrugelige assets med ACL-baseret …
Opfølgning: DeepSeek V4 Flash kører på 2x DGX Spark – RAM-hovedpine
En bruger serverer 304B DeepSeek V4 Flash på tværs af to DGX Spark med 128 GB unified memory hver, men kæmper med OS-hukommelse …
Opfølgning: DeepSeek V4 Flash kører på brugt serverhardware – 33 tok/s på to RTX 3090
… Løsningen koster omkring 6.000 dollars og viser, at CPU-GPU-hybridarkitekturer kan være et alternativ til dyr unified memory.
MemSecBench: Nyt benchmark afslører, at ondsindet hukommelse vedvarer i 84% af agent-angreb
Forskere præsenterer MemSecBench, der sporer livscyklussen for hukommelsesforgiftning i AI-agenter. I 84% af tilfældene overlever den ondsindede hukommelse.
Fractale-350M: Hukommelse som trænet adfærd i stedet for lang kontekst
En solo-forsker udgiver Fractale-350M, hvor hukommelsen er 8 vektorer, der skrives til sig selv – ikke retrieval eller attention over gemt tekst.
Opfølgning: 10 open-source no-code-platforme til LLM-apps og RAG
MarkTechPost runder værktøjer op, mens Google Clouds Always-On Memory Agent og sammenligningen af Kimi K3, DeepSeek V4 Pro og GLM-5.2 også …
Google Cloud lancerer 'Always-On Memory Agent' – erstatter RAG og embeddings
En referenceimplementering på Gemini 3.1 Flash-Lite bruger løbende LLM-konsolidering i stedet for vektordatabase, med SQLite som hukommelse.