¿Alguno habéis montado algún LLM en local?
12-jul-2026 22:32
#31
|
Empieza desde abajo con herramientas sencillas y ve subiendo según te enteres más y pilles soltura.
El subredit /localllama y /localllm son los sitios buenos. Empieza con lm studio y un qwen3.6, ve probando tamaños, configuraciones, toca mucho y lee sin parar, prueba otros modelos más pequeños, más grandes, cuantizaciones, llegaras a tus conclusiones de lo que se ajusta para ti, porque cada uno somos un mundo y nuestros equipos igual. En 2 semanas eres un pro. Si, yo creo que lo más importante es diferenciar (además de posibles alucionaciones), el tema del contexto, porque si no, empieza a olvidar y las alucinaciones se convierten en cosas sin sentido 30000%. Quiza para consultas sencillas, solución de algun problema etc, o tipo conversación sencilla ok, pero en cuanto tiene que recordar X....
conmigo al menos no ha dado ni una qwen 2.5 de 14B corriendo en una 5070, al menos para temas que requieren mucho contexto (analizar una carpeta y toda su estructura, leer ficheros etc...) Yo estoy empezando ahora y he instalado POP!OS de Linux y estoy echando andar un agente openclaw. Ya lo tengo conectado a mi wasa y mi telegram, le he metido un qwen de LLM para entender comandos y otro qwen para reconocer imagnes, espera os pongo aqui los que son usando el comando "openclaw models status" Tengo una RTX 3060 de 12Gb con AMD ryzen 5 (AM5) y 64GB de DDR5. Config : ~/.openclaw/openclaw.json Agent dir : ~/.openclaw/agents/main/agent Default : ollama/qwen3-coder:30b Fallbacks (0) : - Image model : ollama/qwen2.5vl:7b Image fallbacks (0): - Aliases (0) : - Configured models (2): ollama/qwen2.5-coder:14b, ollama/qwen2.5vl:7b Viendo videos del CSV Dot (Carlos) veo que el lo monta todo en entorno Windows, y le rula todo dpm a la primera, sin esfuerzo En cambio a mi no me rula NADA, tengo que pelearme con el puto linux con la consola venga comandos de config, comandos de esto, modificar ficheros de configuracion, cambiar esto, tocar la bios para que me desbloquee el noseke.... SPM Vosotros usais windows? Es realmente mas sencillo de configurar todo en windows ? |
12-jul-2026 23:28
#32
|
lo has montado todo de segunda mano? |
12-jul-2026 23:46
#33
|
yo voy con 9800x3D, 32 gb cl30 6000Mhz y rtx 4070 ti super 16gb vram. gemma 4 26B (MoE) va bastante bien. al menos llama a tools en agentes y sintetiza info de un rag local que ando probando. ahora estoy probandolo con hermes pero no me termina de convencer. qwen 3.6 también lo ando testeando y parece mejor y más rápido. eso sí la diferencia con opus y fable es abismal. |
12-jul-2026 23:48
#34
| Yo solo uno pequeño con ollama. Un qwen 2.5 con 3B en una raspberry pi. No muy útil, a unos 8 tokens por segundo |
13-jul-2026 01:01
#35
|
La torre unos 50€, la fuente de alimentación platinum unos 120€ (para algo que va a estar encedido 24/7 durante 6 o 7 años vale la pena una fuente buena), el SSD una oferta de un amazon day debió ser 300 y algo, y luegos las graficas fueron como 845€ una y 870€ la otra. De aliexpress compré un riser cable PCIe para poder montar la segunda GPU más comodamente por 18€ y hice un adaptador con la impresora 3D para montarla en vertical. Si no contamos el IVA (que me lo han devuelto) debió salirme 2650 o algo así, y si lo contamos pues como 3100€. |
13-jul-2026 01:09
#37
|
Al contrario, como soy autónomo en general me compensa comprar las cosas nuevas porque lo que me ahorro de IVA suele ser más que lo que me costaría de menos algo por ser de segunda mano.Solamente compré usado por 825€ a un chaval de mi ciudad un pack con el Core Ultra 265K, la placa base Z890, los 64gb de DDR5 y un disipador thermalright todo reshulón con pantalla y todo. Lo demás nuevo o refurbished.
La torre unos 50€, la fuente de alimentación platinum unos 120€ (para algo que va a estar encedido 24/7 durante 6 o 7 años vale la pena una fuente buena), el SSD una oferta de un amazon day debió ser 300 y algo, y luegos las graficas fueron como 845€ una y 870€ la otra. De aliexpress compré un riser cable PCIe para poder montar la segunda GPU más comodamente por 18€ y hice un adaptador con la impresora 3D para montarla en vertical. Si no contamos el IVA (que me lo han devuelto) debió salirme 2650 o algo así, y si lo contamos pues como 3100€. hasta que dejo de hacerlo |
13-jul-2026 01:25
#38
| No estoy seguro de a qué te refires. El IVA yo lo pago, pero hacienda me lo devuelve cada 3 meses. Como a cualquier autónomo vamos. |
Editado: 13-jul-2026 01:37 -
13-jul-2026 08:28
#39
| Ollama y modelos de hasta 14b en macbook air m5 con 24gb de ram. Funciona, pero se calienta |
13-jul-2026 08:42
#40
| Yo uso habitualmente Ollama con una RTX5080 y 64GB de RAM. No es comparable a quemar tokens en una de las grandes pero es mejor que las gratuitas. |
13-jul-2026 09:10
#41
|
Si estás dado de alta en el epígrafe de "profesionales diversos" y pasas por la empresa el IVA de una RTX5090, te llegará una carta para que justifiques el gasto, ya que Hacienda sabe que muchos autónomos aprovechan para desgravarse al 100% de compras particulares. |
13-jul-2026 09:26
#42
|
Si no teneis un pepino de la nasa, lo unico que os hace falta es tener una cantidad decentilla de ram, como 32GB, y coges un MoE de la rama qwen QUE VUELAN, porque estan diseñados para ello.
qwen3.6-35B-A3B cuantizado en Q5_K_M y se os quitan las tonterias. inferencia SOLO por CPU, no jodais la arquitectura de expertos cargand una parte en ram y otra en vram porque el ancho del bus pcie y sus latencias os lo haran polvo, sino entra en la gpu entera, con su contexto, mejor a la memoria principal ENTERA. |
13-jul-2026 10:25
#43
|
Se refiere a que como autónomo te puedes desgravar del IVA de las compras que se necesiten estrictamente para el desarrollo de tu actividad profesional y que cada vez hay más auditores y técnicos en Hacienda porque antiguamente la gente intentaba hasta desgravar el IVA de un coche particular siendo diseñador porque creía que iba a colar lo de que se usa al 100% para visitas al cliente.
Si estás dado de alta en el epígrafe de "profesionales diversos" y pasas por la empresa el IVA de una RTX5090, te llegará una carta para que justifiques el gasto, ya que Hacienda sabe que muchos autónomos aprovechan para desgravarse al 100% de compras particulares. Por curiosidad, tengo una app an producción que tiene un router que automático manda las requests de los usuarios a mi servidor de casa si tiene hueco y si los slots están llenos las manda a openrouter |
Editado: 13-jul-2026 10:32 -
13-jul-2026 10:38
#44
|
Piensa que el técnico de Hacienda que hace las inspecciones no es tonto, es alguien que sabe bastante de informática en este caso y que sabe que mucha gente intenta deducirse todo lo posible y diciendo que es al 100% para el trabajo. Otra cosa es deducirlo con un ajuste por ejemplo del 30% trabajo / 70% personal, de un equipo de gama muy alta que vas a destinar en parte para trabajar, ahí sí es muy díficil investigar la dedicación y pasan cualquier cosa, pero las deducciones al 100% de equipos que no casan con el tipo de actividad es carne de inspección. Como el que es visitador médico y pasa el 100% del IVA de un Ferrari, levanta todas las sospechas, aunque necesite un coche para desplazarse y trabajar. |
13-jul-2026 14:45
#45
|
Eso es lo que me refiero, que Hacienda está mirando actualmente lo que ellos llaman "afectación a la actividad". Si tu negocio se basa en hacer aplicaciones web sencillas o SEO, no facturas ni 1.000€/mes y de repente pasas como gasto deducible un portátil gaming de 3.000€, o una GPU de 1.500€ cuando para tu trabajo con una integrada sobra...
Piensa que el técnico de Hacienda que hace las inspecciones no es tonto, es alguien que sabe bastante de informática en este caso y que sabe que mucha gente intenta deducirse todo lo posible y diciendo que es al 100% para el trabajo. Otra cosa es deducirlo con un ajuste por ejemplo del 30% trabajo / 70% personal, de un equipo de gama muy alta que vas a destinar en parte para trabajar, ahí sí es muy díficil investigar la dedicación y pasan cualquier cosa, pero las deducciones al 100% de equipos que no casan con el tipo de actividad es carne de inspección. Como el que es visitador médico y pasa el 100% del IVA de un Ferrari, levanta todas las sospechas, aunque necesite un coche para desplazarse y trabajar. De hecho da un poco igual a lo que te dediques, equipamiento informático es algo que se necesita en cualquier sector, hacienda no tiene tiempo ni ganas de ir por los 400€ de IVA de unas torre, unas GPUs y un SSD, que es muy complicado decir que no es un gasto justificado para tu actividad profesional. Hacienda justamente mira cosas como vehículos, alquileres, viajes y cosas así. Va a lo gordo, no al menudeo. Que además en mi caso está 120% justificado, y si por mi fuese otras 2 GPUs me compraba, con 96gb de vram ya hay cosas muy serias. |
Editado: 13-jul-2026 14:51 -
13-jul-2026 15:16
#46
|
Como amigo de un gestor desde hace 20 años, Hacienda no se pone a cuestionar la compra de material informático. Lo único que te va a cuestionar es si el IVA les sale a ingresar, pero este es otro tema. Lo que hay es que invertir de forma coherente, una RTX5090 no debería ser la primera opción de alguien que realmente quiera trabajar con IA. No deja de ser una tarjeta orientada a gaming. |
13-jul-2026 15:46
#47
|
Os cito shurs para agradeceros vuestros comentarios y la informacion que compartis tan util.
Yo estoy empezando ahora y he instalado POP!OS de Linux y estoy echando andar un agente openclaw. Ya lo tengo conectado a mi wasa y mi telegram, le he metido un qwen de LLM para entender comandos y otro qwen para reconocer imagnes, espera os pongo aqui los que son usando el comando "openclaw models status" Tengo una RTX 3060 de 12Gb con AMD ryzen 5 (AM5) y 64GB de DDR5. Config : ~/.openclaw/openclaw.json Agent dir : ~/.openclaw/agents/main/agent Default : ollama/qwen3-coder:30b Fallbacks (0) : - Image model : ollama/qwen2.5vl:7b Image fallbacks (0): - Aliases (0) : - Configured models (2): ollama/qwen2.5-coder:14b, ollama/qwen2.5vl:7b Viendo videos del CSV Dot (Carlos) veo que el lo monta todo en entorno Windows, y le rula todo dpm a la primera, sin esfuerzo En cambio a mi no me rula NADA, tengo que pelearme con el puto linux con la consola venga comandos de config, comandos de esto, modificar ficheros de configuracion, cambiar esto, tocar la bios para que me desbloquee el noseke.... SPM Vosotros usais windows? Es realmente mas sencillo de configurar todo en windows ? Se agradece la cita! El problema de ollama es que teniendo modelos abiertos, te acabas metiendo solo en un "cerrao", si..es comodo, pero ¿donde guarda los ggufs?¿puedes hacer un backup de los modelos que descargas? ¿puedes compartir los gguf entre distintos programas como llamacpp, lm studio, jan.ai? a que no. ademas, son muy cerdos, porque el motor de inferencia, es de lllamacpp, ellos lo empaquetan con 2 herramientas de terminal y ni hacen mención al proyecto original. cuidado con ollama que NO son de fiar. |
13-jul-2026 15:50
#48
|
pruebate los qwen3.6 2B, LFM2.5-1.2B-Thinking y LFM2.5-1.2B-Instruct , creo que se ajustan mejor a una rpi, lo vas a flipar |
13-jul-2026 15:52
#49
|
lo que te conviene mirar con un apple, es que estes usando los modelos en el formato optimizado para apple silicon, el .mlx, no el .gguf |
Editado: 13-jul-2026 16:11 -
13-jul-2026 15:59
#50
|
22 GB ocupa las versiones cuantizadas. ya el 9B va de pm y genera unas respuestgas que flipas para ser pequeñito, pero ya que estamos, dime cómo hacer volar ese monstruo en local teniendo únicamente 16 gb de vram y 32 gb de ram (config de lmstudio), porque no termino de verlo. para eso me quedo con gemma 4 que tqambién es un MoE y va de pm
No creo que puedas mejorarlo, ademas te reconozco que tengo casi nula experiencia haciendo inferencia por gpu, la estoy haciendo toda por cpu. y si..9B son menos parametros que los 35B de un MoE, pero son densos...alli van todas "las neuronas" empaquetadas y activas a la vez. El que TODOS dicen que es brutal (y yo me lo creo, pero no puedo confirmarlo desde la experiencia) es el qwen3.6-27B. Si das el salto a llamacpp, puedes ganar un 10% de velocidad, lo que si puedes hacer para que tire más fino, una vez que cargas el modelo en memoria, abres el visor de procesos de windows, ordenas por consumo de ram para localiza en que proceso esta cargado el moe (antes de meterle ningun prompt) boton derecho sobre el proceso y le cambias la afinida, si tienes un ryzen, pones la afinidad como en solo los nucleos pares o solo los nucleos impares, asi eliminas lo que ocurre a veces que lm studio de carga 4 hilos que caen (o no) en 4 procesadores logicos correspondientes a solo 2 nucleos fisicos. Haciendolo asi te aseguras un nucleo fisico para cada hilo . Digo 4 porque son 4 los que lm studio marca por defecto para mover los modelos. Lo mismo haria con llamacpp Si el microfuera un intel haria algo parecido pero no se como nombra windows los hilos, entre que pusieorn y quitaron el HT, pochocores con HT, pochocores sin HT, que si quitaron el AVX512... a ver si arreglan los de intel que siempre la competencia es buena para los precios. perdon por el tocho |
13-jul-2026 17:04
#52
|
No creo que puedas mejorarlo, ademas te reconozco que tengo casi nula experiencia haciendo inferencia por gpu, la estoy haciendo toda por cpu.
y si..9B son menos parametros que los 35B de un MoE, pero son densos...alli van todas "las neuronas" empaquetadas y activas a la vez. El que TODOS dicen que es brutal (y yo me lo creo, pero no puedo confirmarlo desde la experiencia) es el qwen3.6-27B. Si das el salto a llamacpp, puedes ganar un 10% de velocidad, lo que si puedes hacer para que tire más fino, una vez que cargas el modelo en memoria, abres el visor de procesos de windows, ordenas por consumo de ram para localiza en que proceso esta cargado el moe (antes de meterle ningun prompt) boton derecho sobre el proceso y le cambias la afinida, si tienes un ryzen, pones la afinidad como en solo los nucleos pares o solo los nucleos impares, asi eliminas lo que ocurre a veces que lm studio de carga 4 hilos que caen (o no) en 4 procesadores logicos correspondientes a solo 2 nucleos fisicos. Haciendolo asi te aseguras un nucleo fisico para cada hilo . Digo 4 porque son 4 los que lm studio marca por defecto para mover los modelos. Lo mismo haria con llamacpp Si el microfuera un intel haria algo parecido pero no se como nombra windows los hilos, entre que pusieorn y quitaron el HT, pochocores con HT, pochocores sin HT, que si quitaron el AVX512... a ver si arreglan los de intel que siempre la competencia es buena para los precios. perdon por el tocho . probaré lo que has dicho, y de perdón nada, que se ve que controlas bastante |
13-jul-2026 17:31
#53
|
Con las morteradas que os gastáis algunos y lo pronto que se deprecia el hardware con la IA, dudo que lo amorticeis en algún momento y eso que no tengo en cuenta lo que gasta usar estos aparatos 24x7 al 100%. Hasta que no evolucione el mercado a TPU/NPU especializadas y no depender de GPUs no veo el sentido a pagar esas cantidades. Antes tiro de openrouter, la suscripción de DeepSeek o vast.ai que correrlo en local |
13-jul-2026 18:59
#54
|
Con las morteradas que os gastáis algunos y lo pronto que se deprecia el hardware con la IA, dudo que lo amorticeis en algún momento y eso que no tengo en cuenta lo que gasta usar estos aparatos 24x7 al 100%.
Hasta que no evolucione el mercado a TPU/NPU especializadas y no depender de GPUs no veo el sentido a pagar esas cantidades. Antes tiro de openrouter, la suscripción de DeepSeek o vast.ai que correrlo en local Discrepo con intensidad. Que va tio, es más a muchos amigos no informaticos pero profesionales de los suyo les recomende y asisti para que se montaran lo suyo local barato (antes de que subiera la memoria). ryzen 5 5600G con 32GB DDR4 3600MHz para los que tiraban a lo minimo por 450€ y los que querian un poco más, ryzen 5 AM5 9600/X con 64GB DDR5 6400MHz, por 750€. y sobre la luz, pues joder..cuando la gente no lo necesita los apaga, placa+cpu+ram,nvme, disipador, 1 ventilador apañado y la fuente, algunos equipos no gastaran ni 100W del enchufe a maxima carga. Gente que no quiere compartir su codigo, sus estructuras, sus rutinas con ninguna empresa cuyo dueño con nariz grande y curvada usara para entrenar sus modelos, gente que hace cosas que no es legal en todos los paises del mundo, gente que tiene que cumplir RGPD, LPD, LGPD, ISO27001 y 20.000 mierdas más. No lo hacen por ahorrar, lo hacen para no incurrir en multas, para no regalar su trabajo, por la confidencialidad de sus clientes o para tener respuestas extendidas que solo un modelo "descensurado/abliterated" te puede conseguir. Por eso solo trabajo con CPU's, no me caso con nadie, ni nvidia, ni intel, ni amd, ni microsoft, si mañana empiezan a poner restricciones, drms, o hacerlos ilegales, pillo una china risc-v con linux, le meto debian y compilo llamacpp para risc-v, si..me ira más lento, pero no me van a parar la infaestructura. me cago en los muertos de todas las nubes, los clouds, las suscripciones y los wokes
|
Editado: 13-jul-2026 19:08 -
13-jul-2026 22:27
#55
| Rpi4 o rpi5? Tengo una rpi4 de 4GB disponible. Querría probar si es minimamente usable. Gracias! |
13-jul-2026 22:28
#56
|
13-jul-2026 22:50
#57
|
Al final es que hay 2 limitaciones: el ancho de banda te dicta la velocidad, pero el tamañó te dicta si entra o no. De cara a tener 4GB entre una rpi4 y una rpi5 la unica diferencia a mismo modelo, SO y cuantización, es la velocidad. Yo le meteria una distro dietpi que son muy muy ligeritas y consumen nada de recursos, https://dietpi.com/, sobre ello llamacpp, sin gui claro y te conectas desde otro equipo, aunque puedes hacer las pruebas con llama-cli. Si ves que el modelo entra y funciona, ya vas probando a: -ver cuanto contexto necesitas -que cuantizacíón te va más entre velocidad vs resolución -bajarte el codigo fuente y compilarte el binario ajustado a la cpu de la rpi4 Asi vas arañando tokens/s de un lado y otro. |
Editado: 13-jul-2026 22:57 -
13-jul-2026 23:13
#58
|
Discrepo con intensidad.
Que va tio, es más a muchos amigos no informaticos pero profesionales de los suyo les recomende y asisti para que se montaran lo suyo local barato (antes de que subiera la memoria). ryzen 5 5600G con 32GB DDR4 3600MHz para los que tiraban a lo minimo por 450€ y los que querian un poco más, ryzen 5 AM5 9600/X con 64GB DDR5 6400MHz, por 750€. y sobre la luz, pues joder..cuando la gente no lo necesita los apaga, placa+cpu+ram,nvme, disipador, 1 ventilador apañado y la fuente, algunos equipos no gastaran ni 100W del enchufe a maxima carga. Gente que no quiere compartir su codigo, sus estructuras, sus rutinas con ninguna empresa cuyo dueño con nariz grande y curvada usara para entrenar sus modelos, gente que hace cosas que no es legal en todos los paises del mundo, gente que tiene que cumplir RGPD, LPD, LGPD, ISO27001 y 20.000 mierdas más. No lo hacen por ahorrar, lo hacen para no incurrir en multas, para no regalar su trabajo, por la confidencialidad de sus clientes o para tener respuestas extendidas que solo un modelo "descensurado/abliterated" te puede conseguir. Por eso solo trabajo con CPU's, no me caso con nadie, ni nvidia, ni intel, ni amd, ni microsoft, si mañana empiezan a poner restricciones, drms, o hacerlos ilegales, pillo una china risc-v con linux, le meto debian y compilo llamacpp para risc-v, si..me ira más lento, pero no me van a parar la infaestructura. me cago en los muertos de todas las nubes, los clouds, las suscripciones y los wokes ![]() Solo haces inferencia con CPU? Con 48-64 gbs de RAM los modelos que ejecutas son pequeños no? Para que los usas? Texto? Imagen y vídeo? Voz? Es curiosidad sana solo |
13-jul-2026 23:15
#59
| Yo con LM studio he podido utilizar un Gemma 4 y comfy con Hermes para un uso muy específico. Generar imágenes para mockup y la verdad que bastante bien. Todo funcionando en una 5070 ti de 12gb |
13-jul-2026 23:35
#60
|
No hacia falta el aviso, pero se agradece Suelo ejecutar el Qwen3.6-35B-A3B, pero alguna vez arranco el Qwen-Next-80B-A3B, solo trabajo con texto, de higos a brevas le meto una imagen con texto directamente. Consultas tecnicas, resumenes, reescritura de texto, cambio de estilo gramatical, corrección de texto, creación de indices. No me gusta que me hagan el trabajo porque se que la lian, pero ....me es más comodo concentrarme en el nucleo de lo que yo se hacer bien, soltar el texto en bruto sin corregir, medio ordenado, metiendo referencias de un parte a otra y decirle: ale, leetelo, une las partes, ponle un indice, ponme las fuentes, ponme la resferencias. Tambien a veces pido ayuda a que me hagan un script, o codigo chorra, se los paso en pseucodigo y se lo pido en el lenguaje chorra de moda. A redactar texto legales o reclamaciones son muy muy buenos. Por fin podemos tener secretaria los pobres. XD |
. probaré lo que has dicho, y de perdón nada, que se ve que controlas bastante