¿Alguno habéis montado algún LLM en local?

europingüino
Eres kangrena
#31
Cita de rgparadela
Empieza por modelos ligeros y ve midiendo tiempos de respuesta.
Cita de Starscream
Empieza desde abajo con herramientas sencillas y ve subiendo según te enteres más y pilles soltura.


El subredit /localllama y /localllm son los sitios buenos.


Empieza con lm studio y un qwen3.6, ve probando tamaños, configuraciones, toca mucho y lee sin parar, prueba otros modelos más pequeños, más grandes, cuantizaciones, llegaras a tus conclusiones de lo que se ajusta para ti, porque cada uno somos un mundo y nuestros equipos igual.


En 2 semanas eres un pro.


Cita de JotaJgreen
Si, yo creo que lo más importante es diferenciar (además de posibles alucionaciones), el tema del contexto, porque si no, empieza a olvidar y las alucinaciones se convierten en cosas sin sentido 30000%. Quiza para consultas sencillas, solución de algun problema etc, o tipo conversación sencilla ok, pero en cuanto tiene que recordar X....
conmigo al menos no ha dado ni una qwen 2.5 de 14B corriendo en una 5070, al menos para temas que requieren mucho contexto (analizar una carpeta y toda su estructura, leer ficheros etc...)
Os cito shurs para agradeceros vuestros comentarios y la informacion que compartis tan util.


Yo estoy empezando ahora y he instalado POP!OS de Linux y estoy echando andar un agente openclaw. Ya lo tengo conectado a mi wasa y mi telegram, le he metido un qwen de LLM para entender comandos y otro qwen para reconocer imagnes, espera os pongo aqui los que son usando el comando "openclaw models status"


Tengo una RTX 3060 de 12Gb con AMD ryzen 5 (AM5) y 64GB de DDR5.




Config : ~/.openclaw/openclaw.json
Agent dir : ~/.openclaw/agents/main/agent
Default : ollama/qwen3-coder:30b
Fallbacks (0) : -
Image model : ollama/qwen2.5vl:7b
Image fallbacks (0): -
Aliases (0) : -
Configured models (2): ollama/qwen2.5-coder:14b, ollama/qwen2.5vl:7b








Viendo videos del CSV Dot (Carlos) veo que el lo monta todo en entorno Windows, y le rula todo dpm a la primera, sin esfuerzo


En cambio a mi no me rula NADA, tengo que pelearme con el puto linux con la consola venga comandos de config, comandos de esto, modificar ficheros de configuracion, cambiar esto, tocar la bios para que me desbloquee el noseke....




SPM


Vosotros usais windows? Es realmente mas sencillo de configurar todo en windows ?
europingüino
Eres kangrena
#32
Cita de CibernoX_CTDI
Yo tengo un servidor en casa con 64gb de ram, 8TB de SSD, 20 cores y 2x7900XTX (48gb de vram en total). Más o menos me costó unos 3000€ todo incluido (caja, disipadores, PSU platinum...).

En general, 24gb de vram es lo mínimo que yo recomendaría.
pues no es tan caro ehn para lo que hay fuera




lo has montado todo de segunda mano?
Sr_Sparks
Bizconde 0_o
#33
yo voy con 9800x3D, 32 gb cl30 6000Mhz y rtx 4070 ti super 16gb vram.
gemma 4 26B (MoE) va bastante bien. al menos llama a tools en agentes y sintetiza info de un rag local que ando probando. ahora estoy probandolo con hermes pero no me termina de convencer.
qwen 3.6 también lo ando testeando y parece mejor y más rápido.
eso sí la diferencia con opus y fable es abismal.
Shurpira
Cuota pagada ✔
#34
Yo solo uno pequeño con ollama. Un qwen 2.5 con 3B en una raspberry pi. No muy útil, a unos 8 tokens por segundo
CibernoX_CTDI
ForoCoches: Miembro
#35
Cita de europingüino
pues no es tan caro ehn para lo que hay fuera




lo has montado todo de segunda mano?
Al contrario, como soy autónomo en general me compensa comprar las cosas nuevas porque lo que me ahorro de IVA suele ser más que lo que me costaría de menos algo por ser de segunda mano.Solamente compré usado por 825€ a un chaval de mi ciudad un pack con el Core Ultra 265K, la placa base Z890, los 64gb de DDR5 y un disipador thermalright todo reshulón con pantalla y todo. Lo demás nuevo o refurbished.

La torre unos 50€, la fuente de alimentación platinum unos 120€ (para algo que va a estar encedido 24/7 durante 6 o 7 años vale la pena una fuente buena), el SSD una oferta de un amazon day debió ser 300 y algo, y luegos las graficas fueron como 845€ una y 870€ la otra. De aliexpress compré un riser cable PCIe para poder montar la segunda GPU más comodamente por 18€ y hice un adaptador con la impresora 3D para montarla en vertical.

Si no contamos el IVA (que me lo han devuelto) debió salirme 2650 o algo así, y si lo contamos pues como 3100€.
ranasaurious
🤖
#36
yo lo probé con una 3070 e iba a pedales
ranasaurious
🤖
#37
Cita de CibernoX_CTDI
Al contrario, como soy autónomo en general me compensa comprar las cosas nuevas porque lo que me ahorro de IVA suele ser más que lo que me costaría de menos algo por ser de segunda mano.Solamente compré usado por 825€ a un chaval de mi ciudad un pack con el Core Ultra 265K, la placa base Z890, los 64gb de DDR5 y un disipador thermalright todo reshulón con pantalla y todo. Lo demás nuevo o refurbished.

La torre unos 50€, la fuente de alimentación platinum unos 120€ (para algo que va a estar encedido 24/7 durante 6 o 7 años vale la pena una fuente buena), el SSD una oferta de un amazon day debió ser 300 y algo, y luegos las graficas fueron como 845€ una y 870€ la otra. De aliexpress compré un riser cable PCIe para poder montar la segunda GPU más comodamente por 18€ y hice un adaptador con la impresora 3D para montarla en vertical.

Si no contamos el IVA (que me lo han devuelto) debió salirme 2650 o algo así, y si lo contamos pues como 3100€.
un colega tambien iba fardando de que no pagaba el iva por ser autónomo


hasta que dejo de hacerlo
CibernoX_CTDI
ForoCoches: Miembro
#38
Cita de ranasaurious
un colega tambien iba fardando de que no pagaba el iva por ser autónomo


hasta que dejo de hacerlo
No estoy seguro de a qué te refires. El IVA yo lo pago, pero hacienda me lo devuelve cada 3 meses. Como a cualquier autónomo vamos.
Vrayan
Hardrocker
#39
Ollama y modelos de hasta 14b en macbook air m5 con 24gb de ram. Funciona, pero se calienta
Altaram
ForoCoches: Miembro
#40
Yo uso habitualmente Ollama con una RTX5080 y 64GB de RAM. No es comparable a quemar tokens en una de las grandes pero es mejor que las gratuitas.
jfromeo
ForoCoches: Miembro
#41
Cita de CibernoX_CTDI
No estoy seguro de a qué te refires. El IVA yo lo pago, pero hacienda me lo devuelve cada 3 meses. Como a cualquier autónomo vamos.
Se refiere a que como autónomo te puedes desgravar del IVA de las compras que se necesiten estrictamente para el desarrollo de tu actividad profesional y que cada vez hay más auditores y técnicos en Hacienda porque antiguamente la gente intentaba hasta desgravar el IVA de un coche particular siendo diseñador porque creía que iba a colar lo de que se usa al 100% para visitas al cliente.

Si estás dado de alta en el epígrafe de "profesionales diversos" y pasas por la empresa el IVA de una RTX5090, te llegará una carta para que justifiques el gasto, ya que Hacienda sabe que muchos autónomos aprovechan para desgravarse al 100% de compras particulares.
Sr_Sparks
Bizconde 0_o
#42
Cita de Starscream
Si no teneis un pepino de la nasa, lo unico que os hace falta es tener una cantidad decentilla de ram, como 32GB, y coges un MoE de la rama qwen QUE VUELAN, porque estan diseñados para ello.


qwen3.6-35B-A3B cuantizado en Q5_K_M y se os quitan las tonterias.




inferencia SOLO por CPU, no jodais la arquitectura de expertos cargand una parte en ram y otra en vram porque el ancho del bus pcie y sus latencias os lo haran polvo, sino entra en la gpu entera, con su contexto, mejor a la memoria principal ENTERA.
22 GB ocupa las versiones cuantizadas. ya el 9B va de pm y genera unas respuestgas que flipas para ser pequeñito, pero ya que estamos, dime cómo hacer volar ese monstruo en local teniendo únicamente 16 gb de vram y 32 gb de ram (config de lmstudio), porque no termino de verlo. para eso me quedo con gemma 4 que tqambién es un MoE y va de pm
CibernoX_CTDI
ForoCoches: Miembro
#43
Cita de jfromeo
Se refiere a que como autónomo te puedes desgravar del IVA de las compras que se necesiten estrictamente para el desarrollo de tu actividad profesional y que cada vez hay más auditores y técnicos en Hacienda porque antiguamente la gente intentaba hasta desgravar el IVA de un coche particular siendo diseñador porque creía que iba a colar lo de que se usa al 100% para visitas al cliente.

Si estás dado de alta en el epígrafe de "profesionales diversos" y pasas por la empresa el IVA de una RTX5090, te llegará una carta para que justifiques el gasto, ya que Hacienda sabe que muchos autónomos aprovechan para desgravarse al 100% de compras particulares.
Pero yo tengo una empresa de desarrollo de software, a ver qué técnico de hacienda me puede decir que un componente informático no está relacionado con mi actividad.

Por curiosidad, tengo una app an producción que tiene un router que automático manda las requests de los usuarios a mi servidor de casa si tiene hueco y si los slots están llenos las manda a openrouter
jfromeo
ForoCoches: Miembro
#44
Cita de CibernoX_CTDI
Pero yo tengo una empresa de desarrollo de software, a ver qué técnico de hacienda me puede decir que un componente informático no está relacionado con mi actividad
Eso es lo que me refiero, que Hacienda está mirando actualmente lo que ellos llaman "afectación a la actividad". Si tu negocio se basa en hacer aplicaciones web sencillas o SEO, no facturas ni 1.000€/mes y de repente pasas como gasto deducible un portátil gaming de 3.000€, o una GPU de 1.500€ cuando para tu trabajo con una integrada sobra...

Piensa que el técnico de Hacienda que hace las inspecciones no es tonto, es alguien que sabe bastante de informática en este caso y que sabe que mucha gente intenta deducirse todo lo posible y diciendo que es al 100% para el trabajo. Otra cosa es deducirlo con un ajuste por ejemplo del 30% trabajo / 70% personal, de un equipo de gama muy alta que vas a destinar en parte para trabajar, ahí sí es muy díficil investigar la dedicación y pasan cualquier cosa, pero las deducciones al 100% de equipos que no casan con el tipo de actividad es carne de inspección. Como el que es visitador médico y pasa el 100% del IVA de un Ferrari, levanta todas las sospechas, aunque necesite un coche para desplazarse y trabajar.
CibernoX_CTDI
ForoCoches: Miembro
#45
Cita de jfromeo
Eso es lo que me refiero, que Hacienda está mirando actualmente lo que ellos llaman "afectación a la actividad". Si tu negocio se basa en hacer aplicaciones web sencillas o SEO, no facturas ni 1.000€/mes y de repente pasas como gasto deducible un portátil gaming de 3.000€, o una GPU de 1.500€ cuando para tu trabajo con una integrada sobra...

Piensa que el técnico de Hacienda que hace las inspecciones no es tonto, es alguien que sabe bastante de informática en este caso y que sabe que mucha gente intenta deducirse todo lo posible y diciendo que es al 100% para el trabajo. Otra cosa es deducirlo con un ajuste por ejemplo del 30% trabajo / 70% personal, de un equipo de gama muy alta que vas a destinar en parte para trabajar, ahí sí es muy díficil investigar la dedicación y pasan cualquier cosa, pero las deducciones al 100% de equipos que no casan con el tipo de actividad es carne de inspección. Como el que es visitador médico y pasa el 100% del IVA de un Ferrari, levanta todas las sospechas, aunque necesite un coche para desplazarse y trabajar.
Está claro que si yo teniendo una empresa de desarrollo me compro un remolque y lo quiero meter como gasto pues hacienda me va a decir que de que me voy, pero que a un desarrollador hacienda no le va a preguntar porqué se monta un servidor con IA.
De hecho da un poco igual a lo que te dediques, equipamiento informático es algo que se necesita en cualquier sector, hacienda no tiene tiempo ni ganas de ir por los 400€ de IVA de unas torre, unas GPUs y un SSD, que es muy complicado decir que no es un gasto justificado para tu actividad profesional.
Hacienda justamente mira cosas como vehículos, alquileres, viajes y cosas así. Va a lo gordo, no al menudeo. Que además en mi caso está 120% justificado, y si por mi fuese otras 2 GPUs me compraba, con 96gb de vram ya hay cosas muy serias.
EnxebreFC
ForoCoches: Usuario
#46
Como amigo de un gestor desde hace 20 años, Hacienda no se pone a cuestionar la compra de material informático. Lo único que te va a cuestionar es si el IVA les sale a ingresar, pero este es otro tema.

Lo que hay es que invertir de forma coherente, una RTX5090 no debería ser la primera opción de alguien que realmente quiera trabajar con IA. No deja de ser una tarjeta orientada a gaming.
Starscream
ForoCoches: Miembro
#47
Cita de europingüino
Os cito shurs para agradeceros vuestros comentarios y la informacion que compartis tan util.


Yo estoy empezando ahora y he instalado POP!OS de Linux y estoy echando andar un agente openclaw. Ya lo tengo conectado a mi wasa y mi telegram, le he metido un qwen de LLM para entender comandos y otro qwen para reconocer imagnes, espera os pongo aqui los que son usando el comando "openclaw models status"


Tengo una RTX 3060 de 12Gb con AMD ryzen 5 (AM5) y 64GB de DDR5.




Config : ~/.openclaw/openclaw.json
Agent dir : ~/.openclaw/agents/main/agent
Default : ollama/qwen3-coder:30b
Fallbacks (0) : -
Image model : ollama/qwen2.5vl:7b
Image fallbacks (0): -
Aliases (0) : -
Configured models (2): ollama/qwen2.5-coder:14b, ollama/qwen2.5vl:7b








Viendo videos del CSV Dot (Carlos) veo que el lo monta todo en entorno Windows, y le rula todo dpm a la primera, sin esfuerzo


En cambio a mi no me rula NADA, tengo que pelearme con el puto linux con la consola venga comandos de config, comandos de esto, modificar ficheros de configuracion, cambiar esto, tocar la bios para que me desbloquee el noseke....




SPM


Vosotros usais windows? Es realmente mas sencillo de configurar todo en windows ?



Se agradece la cita!


El problema de ollama es que teniendo modelos abiertos, te acabas metiendo solo en un "cerrao", si..es comodo, pero ¿donde guarda los ggufs?¿puedes hacer un backup de los modelos que descargas?
¿puedes compartir los gguf entre distintos programas como llamacpp, lm studio, jan.ai? a que no.


ademas, son muy cerdos, porque el motor de inferencia, es de lllamacpp, ellos lo empaquetan con 2 herramientas de terminal y ni hacen mención al proyecto original.


cuidado con ollama que NO son de fiar.
Starscream
ForoCoches: Miembro
#48
Cita de Shurpira
Yo solo uno pequeño con ollama. Un qwen 2.5 con 3B en una raspberry pi. No muy útil, a unos 8 tokens por segundo



pruebate los qwen3.6 2B, LFM2.5-1.2B-Thinking y LFM2.5-1.2B-Instruct , creo que se ajustan mejor a una rpi, lo vas a flipar
Starscream
ForoCoches: Miembro
#49
Cita de Vrayan
Ollama y modelos de hasta 14b en macbook air m5 con 24gb de ram. Funciona, pero se calienta



lo que te conviene mirar con un apple, es que estes usando los modelos en el formato optimizado para apple silicon, el .mlx, no el .gguf
Starscream
ForoCoches: Miembro
#50
Cita de Sr_Sparks
22 GB ocupa las versiones cuantizadas. ya el 9B va de pm y genera unas respuestgas que flipas para ser pequeñito, pero ya que estamos, dime cómo hacer volar ese monstruo en local teniendo únicamente 16 gb de vram y 32 gb de ram (config de lmstudio), porque no termino de verlo. para eso me quedo con gemma 4 que tqambién es un MoE y va de pm



No creo que puedas mejorarlo, ademas te reconozco que tengo casi nula experiencia haciendo inferencia por gpu, la estoy haciendo toda por cpu.


y si..9B son menos parametros que los 35B de un MoE, pero son densos...alli van todas "las neuronas" empaquetadas y activas a la vez.


El que TODOS dicen que es brutal (y yo me lo creo, pero no puedo confirmarlo desde la experiencia) es el qwen3.6-27B.


Si das el salto a llamacpp, puedes ganar un 10% de velocidad, lo que si puedes hacer para que tire más fino, una vez que cargas el modelo en memoria, abres el visor de procesos de windows, ordenas por consumo de ram para localiza en que proceso esta cargado el moe (antes de meterle ningun prompt) boton derecho sobre el proceso y le cambias la afinida, si tienes un ryzen, pones la afinidad como en solo los nucleos pares o solo los nucleos impares, asi eliminas lo que ocurre a veces que lm studio de carga 4 hilos que caen (o no) en 4 procesadores logicos correspondientes a solo 2 nucleos fisicos. Haciendolo asi te aseguras un nucleo fisico para cada hilo .


Digo 4 porque son 4 los que lm studio marca por defecto para mover los modelos.
Lo mismo haria con llamacpp
Si el microfuera un intel haria algo parecido pero no se como nombra windows los hilos, entre que pusieorn y quitaron el HT, pochocores con HT, pochocores sin HT, que si quitaron el AVX512... a ver si arreglan los de intel que siempre la competencia es buena para los precios.


perdon por el tocho
Shurpira
Cuota pagada ✔
#51
Cita de Starscream
pruebate los qwen3.6 2B, LFM2.5-1.2B-Thinking y LFM2.5-1.2B-Instruct , creo que se ajustan mejor a una rpi, lo vas a flipar
Pues muchas gracias por el consejo!! Lo pruebo al llegar a casa!
Sr_Sparks
Bizconde 0_o
#52
Cita de Starscream
No creo que puedas mejorarlo, ademas te reconozco que tengo casi nula experiencia haciendo inferencia por gpu, la estoy haciendo toda por cpu.


y si..9B son menos parametros que los 35B de un MoE, pero son densos...alli van todas "las neuronas" empaquetadas y activas a la vez.


El que TODOS dicen que es brutal (y yo me lo creo, pero no puedo confirmarlo desde la experiencia) es el qwen3.6-27B.


Si das el salto a llamacpp, puedes ganar un 10% de velocidad, lo que si puedes hacer para que tire más fino, una vez que cargas el modelo en memoria, abres el visor de procesos de windows, ordenas por consumo de ram para localiza en que proceso esta cargado el moe (antes de meterle ningun prompt) boton derecho sobre el proceso y le cambias la afinida, si tienes un ryzen, pones la afinidad como en solo los nucleos pares o solo los nucleos impares, asi eliminas lo que ocurre a veces que lm studio de carga 4 hilos que caen (o no) en 4 procesadores logicos correspondientes a solo 2 nucleos fisicos. Haciendolo asi te aseguras un nucleo fisico para cada hilo .


Digo 4 porque son 4 los que lm studio marca por defecto para mover los modelos.
Lo mismo haria con llamacpp
Si el microfuera un intel haria algo parecido pero no se como nombra windows los hilos, entre que pusieorn y quitaron el HT, pochocores con HT, pochocores sin HT, que si quitaron el AVX512... a ver si arreglan los de intel que siempre la competencia es buena para los precios.


perdon por el tocho
mmm pues al final he conseguido velocidad aceptable tuneando los dos moe. cada uno lleva una config distinta (gemma4 y qwen 3.6 moe)eso sí, la memoria se peta entera mientras hace inferencia. lo bueno es que hermes ya se pone creativo y lanza tasks y si está idle, lm studio descarga las capas o el modelo entero si cabe de la vram por si hay que hacer algo adicional. probaré lo que has dicho, y de perdón nada, que se ve que controlas bastante
CheckCenter
ForoCoches: Miembro
#53
Con las morteradas que os gastáis algunos y lo pronto que se deprecia el hardware con la IA, dudo que lo amorticeis en algún momento y eso que no tengo en cuenta lo que gasta usar estos aparatos 24x7 al 100%.

Hasta que no evolucione el mercado a TPU/NPU especializadas y no depender de GPUs no veo el sentido a pagar esas cantidades. Antes tiro de openrouter, la suscripción de DeepSeek o vast.ai que correrlo en local
Starscream
ForoCoches: Miembro
#54
Cita de CheckCenter
Con las morteradas que os gastáis algunos y lo pronto que se deprecia el hardware con la IA, dudo que lo amorticeis en algún momento y eso que no tengo en cuenta lo que gasta usar estos aparatos 24x7 al 100%.

Hasta que no evolucione el mercado a TPU/NPU especializadas y no depender de GPUs no veo el sentido a pagar esas cantidades. Antes tiro de openrouter, la suscripción de DeepSeek o vast.ai que correrlo en local

Discrepo con intensidad.


Que va tio, es más a muchos amigos no informaticos pero profesionales de los suyo les recomende y asisti para que se montaran lo suyo local barato (antes de que subiera la memoria).


ryzen 5 5600G con 32GB DDR4 3600MHz para los que tiraban a lo minimo por 450€
y los que querian un poco más, ryzen 5 AM5 9600/X con 64GB DDR5 6400MHz, por 750€.


y sobre la luz, pues joder..cuando la gente no lo necesita los apaga, placa+cpu+ram,nvme, disipador, 1 ventilador apañado y la fuente, algunos equipos no gastaran ni 100W del enchufe a maxima carga.


Gente que no quiere compartir su codigo, sus estructuras, sus rutinas con ninguna empresa cuyo dueño con nariz grande y curvada usara para entrenar sus modelos, gente que hace cosas que no es legal en todos los paises del mundo, gente que tiene que cumplir RGPD, LPD, LGPD, ISO27001 y 20.000 mierdas más.


No lo hacen por ahorrar, lo hacen para no incurrir en multas, para no regalar su trabajo, por la confidencialidad de sus clientes o para tener respuestas extendidas que solo un modelo "descensurado/abliterated" te puede conseguir.


Por eso solo trabajo con CPU's, no me caso con nadie, ni nvidia, ni intel, ni amd, ni microsoft, si mañana empiezan a poner restricciones, drms, o hacerlos ilegales, pillo una china risc-v con linux, le meto debian y compilo llamacpp para risc-v, si..me ira más lento, pero no me van a parar la infaestructura.


me cago en los muertos de todas las nubes, los clouds, las suscripciones y los wokes
popeie
Fallo al cargar la imagen
#55
Rpi4 o rpi5? Tengo una rpi4 de 4GB disponible. Querría probar si es minimamente usable. Gracias!
popeie
Fallo al cargar la imagen
#56
Cita de Starscream
pruebate los qwen3.6 2B, LFM2.5-1.2B-Thinking y LFM2.5-1.2B-Instruct , creo que se ajustan mejor a una rpi, lo vas a flipar
  • Rpi4 o rpi5? Tengo una rpi4 de 4GB disponible. Querría probar si es minimamente usable. Gracias!
Starscream
ForoCoches: Miembro
#57
Cita de popeie
  • Rpi4 o rpi5? Tengo una rpi4 de 4GB disponible. Querría probar si es minimamente usable. Gracias!



Al final es que hay 2 limitaciones: el ancho de banda te dicta la velocidad, pero el tamañó te dicta si entra o no.


De cara a tener 4GB entre una rpi4 y una rpi5 la unica diferencia a mismo modelo, SO y cuantización, es la velocidad.




Yo le meteria una distro dietpi que son muy muy ligeritas y consumen nada de recursos, https://dietpi.com/, sobre ello llamacpp, sin gui claro y te conectas desde otro equipo, aunque puedes hacer las pruebas con llama-cli.


Si ves que el modelo entra y funciona, ya vas probando a:


-ver cuanto contexto necesitas
-que cuantizacíón te va más entre velocidad vs resolución
-bajarte el codigo fuente y compilarte el binario ajustado a la cpu de la rpi4


Asi vas arañando tokens/s de un lado y otro.
Lord-Blade
ForoCoches: Miembro
#58
Cita de Starscream
Discrepo con intensidad.


Que va tio, es más a muchos amigos no informaticos pero profesionales de los suyo les recomende y asisti para que se montaran lo suyo local barato (antes de que subiera la memoria).


ryzen 5 5600G con 32GB DDR4 3600MHz para los que tiraban a lo minimo por 450€
y los que querian un poco más, ryzen 5 AM5 9600/X con 64GB DDR5 6400MHz, por 750€.


y sobre la luz, pues joder..cuando la gente no lo necesita los apaga, placa+cpu+ram,nvme, disipador, 1 ventilador apañado y la fuente, algunos equipos no gastaran ni 100W del enchufe a maxima carga.


Gente que no quiere compartir su codigo, sus estructuras, sus rutinas con ninguna empresa cuyo dueño con nariz grande y curvada usara para entrenar sus modelos, gente que hace cosas que no es legal en todos los paises del mundo, gente que tiene que cumplir RGPD, LPD, LGPD, ISO27001 y 20.000 mierdas más.


No lo hacen por ahorrar, lo hacen para no incurrir en multas, para no regalar su trabajo, por la confidencialidad de sus clientes o para tener respuestas extendidas que solo un modelo "descensurado/abliterated" te puede conseguir.


Por eso solo trabajo con CPU's, no me caso con nadie, ni nvidia, ni intel, ni amd, ni microsoft, si mañana empiezan a poner restricciones, drms, o hacerlos ilegales, pillo una china risc-v con linux, le meto debian y compilo llamacpp para risc-v, si..me ira más lento, pero no me van a parar la infaestructura.


me cago en los muertos de todas las nubes, los clouds, las suscripciones y los wokes
Aviso que no es ataque.


Solo haces inferencia con CPU?
Con 48-64 gbs de RAM los modelos que ejecutas son pequeños no?


Para que los usas? Texto? Imagen y vídeo? Voz?


Es curiosidad sana solo
Caska
ForoCoches: Usuario
#59
Yo con LM studio he podido utilizar un Gemma 4 y comfy con Hermes para un uso muy específico. Generar imágenes para mockup y la verdad que bastante bien. Todo funcionando en una 5070 ti de 12gb
Starscream
ForoCoches: Miembro
#60
Cita de Lord-Blade
Aviso que no es ataque.


Solo haces inferencia con CPU?
Con 48-64 gbs de RAM los modelos que ejecutas son pequeños no?


Para que los usas? Texto? Imagen y vídeo? Voz?


Es curiosidad sana solo

No hacia falta el aviso, pero se agradece (hay gente tan blandita que no estar de acuerdo con ellos ya los pone tensos).


Suelo ejecutar el Qwen3.6-35B-A3B, pero alguna vez arranco el Qwen-Next-80B-A3B, solo trabajo con texto, de higos a brevas le meto una imagen con texto directamente.


Consultas tecnicas, resumenes, reescritura de texto, cambio de estilo gramatical, corrección de texto, creación de indices.


No me gusta que me hagan el trabajo porque se que la lian, pero ....me es más comodo concentrarme en el nucleo de lo que yo se hacer bien, soltar el texto en bruto sin corregir, medio ordenado, metiendo referencias de un parte a otra y decirle: ale, leetelo, une las partes, ponle un indice, ponme las fuentes, ponme la resferencias.


Tambien a veces pido ayuda a que me hagan un script, o codigo chorra, se los paso en pseucodigo y se lo pido en el lenguaje chorra de moda.


A redactar texto legales o reclamaciones son muy muy buenos.


Por fin podemos tener secretaria los pobres. XD
← A Electrónica / Informática
Amazon
Nuevas ofertas cada día