Elektrine lite

← Feed

@ximo@tkz.one

Post #1692848

2026-04-25 17:10 UTC

@paelnever @iclavijos ¿Qué ordenador baratito te da 5 tokens/segundo? ¿Cuánta RAM tiene ese ordenador baratito? Qué modelos ejecuta? He probado prácticamente todos los modelos "open source" de 15mil millones de parámetros o menos y ninguno es capaz de programar usando tools en cosas como opencode. Son inútiles. Incapaces de entender un fichero Python de 200 líneas. En un i7 con 32GB de RAM he probado esta mañana el modelo mistral 7b con opencode y me ha tardado 19 minutos en contestar un simple "hi". Luego me he pedido que echara un ojo a unos ficheros Python y ahí sigue varias horas después.

Replies (1)

  • @paelnever@masto.es 2026-04-25 17:57

    @ximo @iclavijos Efectivamente el problema actual está en el hardware, no en el software. Hay que buscarse la vida bastante pero no es imposible. Te doy la idea mas barata que se me ocurre aunque las hay mejores con un poco mas de presupuesto. Pongamos que tienes 500 pavos. En cierta tienda online china que no voy a mencionar compré hace 1 año: - Kit de placa base Dual X99, con 2*Xeon E5 2680V4 y 4*16GB 2400Mhz DDR4 RAM, por 320 pavos el kit - un par de disipadores para xeon, 40 pavos - Disco SSD 256 GB, 40 pavos - fuente alimentación 700W, 50 - caja usé una reciclada de un ordenador viejo pero las venden por 20 pavos - No necesita teclado ni gráfica ni pantalla, conecto por SSH o VNC para hacer cambios pero por defecto el sistema está configurado para ejecutar el modelo en vllm y servirlo por red local Aun me sobran 50 de los 500, ojo, los micros son reacondicionados. A esa placa ahora mismo le saco un poco mas de 6T/s corriendo una versión tuneada de un modelo MOE de 35B parámetros usando la técnica de "flash speculative decoding", concretamente z-lab/Qwen3.6-35B-A3B-DFlash Seguramente estés pensando que esto no es la opción fácil de ejecutar con unos clics que mencionaba arriba pero arriba estaba refiriéndome a los "IAbros" que si quieren correr modelos en local se gastan tres mi pavos en un DGX spark y corren modelos de 60B parámetros a 20T/s. En ese hardware si lo pueden hacer con unos clics en la propia herramienta que trae el cacharro o con las otras que he mencionado antes. No te voy a decir que con ese modelo puedas factorizar proyectos complejos enteros pero si puedes hacer cositas útiles puntuales y sabiendo lo que haces. Antes del apocalipsis de la ram se podían encontrar servidores dell de segunda mano con quad xeon y 500GB de ram por menos de mil pavos. No es casualidad que el hardware esté tan caro ahora, las megacorps de silicon valley necesitan desesperadamente que la gente no pueda correr modelos de IA en su casa.

    Open ##1692849