Elektrine lite

← Feed

@madsenandersc@social.vivaldi.net

Post #4159679

2026-07-28 08:55 UTC

@LarsHenriksen@mastodon.nu Uha - det er et ret omfattende spørgsmål med en hel masse variabler, så det er ikke så let at svare på. Der er to ressourcer, der er i spil: RAM og GPU-kraft. RAM-mængden har indflydelse på kvaliteten af de svar, man kan få fra sin egen LLM. Jo større en LLM er, jo mere nuancerede og pålidelige svar kan man få, alt andet lige. GPU-kraften har indflydelse på, hvor hurtigt, man kan få sine svar. Jo større din LLM er, jo flere kræfter skal der til for at lave et svar - igen, alt andet lige. Udfordringen er altså at finde en LLM-model, der leverer svar, der er "gode nok" til at opfylde ens behov i forhold til kvalitet og hastighed, og så finde hardware, der passer til netop det behov. Jeg ved på ingen måde nok til at kunne give råd om store implementeringer af LLM-løsninger, men jeg kan illustrere nogen af udfordringerne med min egen løsning. Jeg bruger en lokal computer med Ollama til inferens og AnythingLLM som interface. Hardwaren er en AMD Ryzen 7 8700G med en indbygget Radeon 780M GPU, som har fået tildelt 16GB dedikeret RAM i BIOS. Det er altså meget begrænset hardware, ikke ulig den, man kan finde i en kraftig bærbar computer. 1/2

Replies (1)

  • @LarsHenriksen@mastodon.nu På den hardware kører jeg primært 3 modeller: Mistral-3:3B Mistral-3:8B Mistral-3:14B Den mindste model (3b) bruger jeg primært til hurtige opslag som jeg ikke skal bruge til noget vigtigt. Her får jeg omkring 18 tokens/sekund, og svaret starter med at komme stort set øjeblikkeligt og er færdigt på under et minut. Den midterste model (8b) er den, jeg bruger når der skal laves en lidt mere omfattende indsamling af data fra flere kilder og holdes styr på dem, indtil de puttes i en sammenfattende tekst. Her får jeg omkring 8-10 tokens/sekund, hvilket giver mig et svar på 1-3 minutter. Den største model (14b) bruger jeg, hvis der skal samles data fra flere kilder og laves en grundigere analyse af dem. Her får jeg som regel 5 tokens/sekund, så et svar tager tit 5-10 minutter. Kvaliteten er ofte på et niveau, der ligger omkring eller lidt under kvaliteten på https://chat.mistral.ai/chat Alle svar kommer serielt, så ét svar skal være færdigt før det næste begynder at komme. Det vil være håbløst i et scenarie med 1000 elever, og det er derfor, jeg slet ikke tør sige noget om, hvordan det løses i praksis. :) 2/2

    Open ##4159678