¿Alguno habéis montado algún LLM en local?

Angelitro
ForoCoches: Usuario
#1
¿Cuánto habéis invertido?


¿qué équipo tenéis y que características tiene (CPU/GPU, RAM, etc.)


¿Os está dando buenos resultados?
leesin
Platino II
#2
Hay un hilo hablando sobre ello, por si no lo conocías:


https://forocoches.com/foro/showthread.php?t=10099080
trunyoz
🖕🖕🖕🖕🖕🖕
#3
Cita de Angelitro
¿Cuánto habéis invertido?


¿qué équipo tenéis y que características tiene (CPU/GPU, RAM, etc.)


¿Os está dando buenos resultados?
https://www.canirun.ai/
Angelitro
ForoCoches: Usuario
#4
Cita de leesin
Hay un hilo hablando sobre ello, por si no lo conocías:


https://forocoches.com/foro/showthread.php?t=10099080
Gracias!
Angelitro
ForoCoches: Usuario
#5
Cita de trunyoz
Gracias! muy util
Reggaeton
ForoCoches: Usuario
#6
Si con LMstudio pero son todas una mierda, ni aunque tengas 96gb de ram para tirar modelos “decentes”

Al menos para desarrollo no hay color
JotaJgreen
No man behind!
#7
Cita de Reggaeton
Si con LMstudio pero son todas una mierda, ni aunque tengas 96gb de ram para tirar modelos “decentes”

Al menos para desarrollo no hay color
Si, yo creo que lo más importante es diferenciar (además de posibles alucionaciones), el tema del contexto, porque si no, empieza a olvidar y las alucinaciones se convierten en cosas sin sentido 30000%. Quiza para consultas sencillas, solución de algun problema etc, o tipo conversación sencilla ok, pero en cuanto tiene que recordar X....
conmigo al menos no ha dado ni una qwen 2.5 de 14B corriendo en una 5070, al menos para temas que requieren mucho contexto (analizar una carpeta y toda su estructura, leer ficheros etc...)
Reggaeton
ForoCoches: Usuario
#8
Cita de JotaJgreen
Si, yo creo que lo más importante es diferenciar (además de posibles alucionaciones), el tema del contexto, porque si no, empieza a olvidar y las alucinaciones se convierten en cosas sin sentido 30000%. Quiza para consultas sencillas, solución de algun problema etc, o tipo conversación sencilla ok, pero en cuanto tiene que recordar X....
conmigo al menos no ha dado ni una qwen 2.5 de 14B corriendo en una 5070, al menos para temas que requieren mucho contexto (analizar una carpeta y toda su estructura, leer ficheros etc...)
Es que para preguntas sencillas ya tienes las tipicas gratis en la nube
Y para las cosas complejas pues tambien ya que estas no llegan


Yo la he usado para un experimento de juego web, con instrucciones de responder X o Y segun lo que haga el usuario y para algo asi tan sencillo ni tan mal.


Pero de resto, probamos algunas tochas en el M3 ultra de 96 de ram de un colega y no me acuerdo que modelos probamos pero ninguno se acercaba ni lo mas minimo al Opus 4.7 o GPT 5.5, ni con 96 de ram...


La IA local para algunas empresas tochas que no les importa gastar millonadas de ram pues igual, para el resto no es mas que un mero experimento que aporta poco
Starscream
ForoCoches: Miembro
#9
Si no teneis un pepino de la nasa, lo unico que os hace falta es tener una cantidad decentilla de ram, como 32GB, y coges un MoE de la rama qwen QUE VUELAN, porque estan diseñados para ello.


qwen3.6-35B-A3B cuantizado en Q5_K_M y se os quitan las tonterias.




inferencia SOLO por CPU, no jodais la arquitectura de expertos cargand una parte en ram y otra en vram porque el ancho del bus pcie y sus latencias os lo haran polvo, sino entra en la gpu entera, con su contexto, mejor a la memoria principal ENTERA.
felizycontento
ForoCoches: Miembro
#10
Cita de Starscream
Si no teneis un pepino de la nasa, lo unico que os hace falta es tener una cantidad decentilla de ram, como 32GB, y coges un MoE de la rama qwen QUE VUELAN, porque estan diseñados para ello.

qwen3.6-35B-A3B cuantizado en Q5_K_M y se os quitan las tonterias.


inferencia SOLO por CPU, no jodais la arquitectura de expertos cargand una parte en ram y otra en vram porque el ancho del bus pcie y sus latencias os lo haran polvo, sino entra en la gpu entera, con su contexto, mejor a la memoria principal ENTERA.
Dices que va aceptablemente rápido, pero sirve para hacer algo?
Starscream
ForoCoches: Miembro
#11
Cita de felizycontento
Dices que va aceptablemente rápido, pero sirve para hacer algo?

12tk/s con lm studio y 13.5 en llamacpp con el webserver, con un ryzen 5 5500 y unas memorias DDR4 3600MHz CL20


lo preguntas/pides lo que quieras por el webchat, lo conectas con api a otra herramienta para acoplarlo.


lo que no tiene sentido es que esteis jugando con modelos viejos Y densos.
AJ4X
ForoCoches: Miembro
#12
M5 pro con 64gb de ram. En mi dia a dia uso qwen3.6-35B-A3B con lmstudio para programar y hay dias que ni utilizo claude.

Para tareas complejas si o si tienes que a caer a claude pero la mayoria del dia a dia todo bien con ese modelo.

He probado muchos modelos y el que mejor resultado me ha dado ha sido ese.. si alguien tiene alternativas que pueda probar citadme!!
Starscream
ForoCoches: Miembro
#13
Cita de AJ4X
M5 pro con 64gb de ram. En mi dia a dia uso qwen3.6-35B-A3B con lmstudio para programar y hay dias que ni utilizo claude.

Para tareas complejas si o si tienes que a caer a claude pero la mayoria del dia a dia todo bien con ese modelo.

He probado muchos modelos y el que mejor resultado me ha dado ha sido ese.. si alguien tiene alternativas que pueda probar citadme!!

Para tareas finas y contextos largos la cuantización es superimportante, un Q3_K_M queda muy tonto...un Q4_K_M, parece que va bien pero se acaba liando a la larga.


Lo suyo en mi opinion para los que no tenemos apple, o sea que en vez de MLX tiramos de GGUF, es Q5_K_M y si va rapido incluso Q6_K_M.


Tambien es importante ajustar el numero de hilos, por cpu sola, con 4 hilos va de sobra (al menos, bajo DDR4), total, el freno es el ancho de banda de memoria, tener más hilos empeora el resultado, igual que el MTP, ese fuera.


Si se pone uno fino y asigna luego los hilos del llamacpp solo a 1 hilo por cada core fisico en amd y en intel lo mismo pero ademas pasando de los pocho cores.


dejo por aqui el comando con el que lo arranco por si le sirve a alguien:

llama-server.exe -m "H:\GGUF\bartowski\Qwen_Qwen3.6-35B-A3B-GGUF\Qwen_Qwen3.6-35B-A3B-Q5_K_L.gguf" --no-mmap -c 32768 -t 4 --port 40018 --host 0.0.0.0 --reasoning off --temp 0.7 --top-p 0.80 --top-k 20 --min-p 0.0 --presence-penalty 1.5 --repeat-penalty 1.0
felizycontento
ForoCoches: Miembro
#14
Cita de Starscream
Para tareas finas y contextos largos la cuantización es superimportante, un Q3_K_M queda muy tonto...un Q4_K_M, parece que va bien pero se acaba liando a la larga.


Lo suyo en mi opinion para los que no tenemos apple, o sea que en vez de MLX tiramos de GGUF, es Q5_K_M y si va rapido incluso Q6_K_M.


Tambien es importante ajustar el numero de hilos, por cpu sola, con 4 hilos va de sobra (al menos, bajo DDR4), total, el freno es el ancho de banda de memoria, tener más hilos empeora el resultado, igual que el MTP, ese fuera.


Si se pone uno fino y asigna luego los hilos del llamacpp solo a 1 hilo por cada core fisico en amd y en intel lo mismo pero ademas pasando de los pocho cores.


dejo por aqui el comando con el que lo arranco por si le sirve a alguien:

llama-server.exe -m "H:\GGUF\bartowski\Qwen_Qwen3.6-35B-A3B-GGUF\Qwen_Qwen3.6-35B-A3B-Q5_K_L.gguf" --no-mmap -c 32768 -t 4 --port 40018 --host 0.0.0.0 --reasoning off --temp 0.7 --top-p 0.80 --top-k 20 --min-p 0.0 --presence-penalty 1.5 --repeat-penalty 1.0
Muchas gracias, lo probaré.


Dices que lo usas con 32gb de ram?
Erclon Muska
Tecnonigromante
#15
Cita de Starscream
Para tareas finas y contextos largos la cuantización es superimportante, un Q3_K_M queda muy tonto...un Q4_K_M, parece que va bien pero se acaba liando a la larga.


Lo suyo en mi opinion para los que no tenemos apple, o sea que en vez de MLX tiramos de GGUF, es Q5_K_M y si va rapido incluso Q6_K_M.


Tambien es importante ajustar el numero de hilos, por cpu sola, con 4 hilos va de sobra (al menos, bajo DDR4), total, el freno es el ancho de banda de memoria, tener más hilos empeora el resultado, igual que el MTP, ese fuera.


Si se pone uno fino y asigna luego los hilos del llamacpp solo a 1 hilo por cada core fisico en amd y en intel lo mismo pero ademas pasando de los pocho cores.


dejo por aqui el comando con el que lo arranco por si le sirve a alguien:

llama-server.exe -m "H:\GGUF\bartowski\Qwen_Qwen3.6-35B-A3B-GGUF\Qwen_Qwen3.6-35B-A3B-Q5_K_L.gguf" --no-mmap -c 32768 -t 4 --port 40018 --host 0.0.0.0 --reasoning off --temp 0.7 --top-p 0.80 --top-k 20 --min-p 0.0 --presence-penalty 1.5 --repeat-penalty 1.0

¿Has probado en Linux si mejoras?, con GPU noto mejoría allí en general, con CPU no he inferido mucho.


¿Si amplías el contexto al cuadruple notas caída de tokens o sigues igual?, porque tengo 64GB de RAM en un 9800X3D y no estaría de más sacarle jugo con un contexto más grande.


Gracias por el aporte shur.
Starscream
ForoCoches: Miembro
#16
Cita de felizycontento
Muchas gracias, lo probaré.


Dices que lo usas con 32gb de ram?

Tengo 64GB, pero en uso, llamacpp con ese modelo nunca me gastó más de 28GB, por eso digo que se puede usar con 32GB. (claro, controlando que tengas 20.000 procesos locos de fondo)


El swap lo tengo desactivado.
Starscream
ForoCoches: Miembro
#17
Cita de Erclon Muska
¿Has probado en Linux si mejoras?, con GPU noto mejoría allí en general, con CPU no he inferido mucho.


¿Si amplías el contexto al cuadruple notas caída de tokens o sigues igual?, porque tengo 64GB de RAM en un 9800X3D y no estaría de más sacarle jugo con un contexto más grande.


Gracias por el aporte shur.

A la primera pregunta la respuesta es "a medias". uso windows y linux pero linux lo corro virtualizado, entonces se que los resultados estan "frenados", lo que si probe es a compilar con distintas versiones de gcc y distintos flags llamacpp y no pasaba de ganancias del 2-3% en linux virtualizado, baremetal a pelo...pues se supone que podria ser un 10% extra.


mis gpus son una caca ambas, un par de rx 550's 4GB, pero para autocompletado con un ibm granite pequeño en vs studi code, sirven, y asi no le meto tanta carga a la cpu.


Le puedo ampliar el contexto, pero la verdad es que mis interacciones no son tan largas y ya tengo cogida la costumbre de hacerlo por bloque y empezar conversacion nueva.


Se programar pero no me gano la vida con ello, no lo tengo picando codigo todo el dia, otra cosa es que tenga que hace run script, mantener algun codigo o algo más ligero que le paso la algoritimia en pseudocodigo y pido que lo implemente en tal lenguaje.


¿que modelos "descensurados" usais? ya que estamos hablando de este tema.


yo tiro de momento con este https://huggingface.co/huihui-ai/Hui...rated-MTP-GGUF pero quiero ver si alguno mejor. (sin usar el MTP)


*consejo: quitale el pbo a ese 9800X3D y no lo pongas a hacer inferencia si no tienes AC....que se va a poner la cosa muy malita en piezas.
Erclon Muska
Tecnonigromante
#18
Cita de Starscream
A la primera pregunta la respuesta es "a medias". uso windows y linux pero linux lo corro virtualizado, entonces se que los resultados estan "frenados", lo que si probe es a compilar con distintas versiones de gcc y distintos flags llamacpp y no pasaba de ganancias del 2-3% en linux virtualizado, baremetal a pelo...pues se supone que podria ser un 10% extra.


mis gpus son una caca ambas, un par de rx 550's 4GB, pero para autocompletado con un ibm granite pequeño en vs studi code, sirven, y asi no le meto tanta carga a la cpu.


Le puedo ampliar el contexto, pero la verdad es que mis interacciones no son tan largas y ya tengo cogida la costumbre de hacerlo por bloque y empezar conversacion nueva.


Se programar pero no me gano la vida con ello, no lo tengo picando codigo todo el dia, otra cosa es que tenga que hace run script, mantener algun codigo o algo más ligero que le paso la algoritimia en pseudocodigo y pido que lo implemente en tal lenguaje.


¿que modelos "descensurados" usais? ya que estamos hablando de este tema.


yo tiro de momento con este https://huggingface.co/huihui-ai/Hui...rated-MTP-GGUF pero quiero ver si alguno mejor. (sin usar el MTP)


*consejo: quitale el pbo a ese 9800X3D y no lo pongas a hacer inferencia si no tienes AC....que se va a poner la cosa muy malita en piezas.

Con GPU, la diferencia aprox en mi caso es de 20% de Windows a Linux en favor, esto con una 4080. Con mi anterior RX 7900 XT era parecido. Por eso te preguntaba, suele merecer la pena un dual boot para estos menesteres al menos en GPU, puede que en CPU también te merezca la pena.


Puedes vender esas RX 550 y pillar algo como una Mi 50 de 16GB, andan rondando los 100 y pocos. Lo único que tendrías que tirar del backend de Vulkan en Windows, en Linux si podrías usar ROCm... aunque la diferencia a día de hoy en LLM no es mucha con ambos backend.


Curiosamente como modelo estrella ahora, estoy usando un Qwen3.6 también, un Qwen3.6-34B-80L-Fable-5-Heretic.i1-Q4_K_M (de mradermacher). Lo cargo en la RTX 4080 y luego en la Mi 50 de 16GB que tengo en un servidor, uso RPC de llama para cargar capas en esta (tienes que compilarlo con las flags adecuadas para que funcione, ya que es experimental), penaliza un poco en tokens pero corre bien, lanzándolo así:


./llama-server -ngl 99 -m$MODEL --temp 0.0 --top-p 0.95 --top-k 64 --min-p 0.00 --fit on --jinja --flash-attn on --ctx-size 196608 --ctx-checkpoints 256 --cache-ram -1 --cache-type-k q8_0 --cache-type-v q8_0 --threads 8 --threads-batch 16 --no-mmap -np 1 --rpc 192.168.0.2:50052 --tensor-split 55,45 --host 0.0.0.0


El 9800X3D está con PPT, TDC y EDC de origen, +200 de frecuencia, Scalar a 1x (de serie) y Curve Optimizer en bastantes núcleos a -20 y -30, en el más tragón a -15 y el más vago -35. Se ha comido bastantes horas de CoreCycler con bastantes test, juegos y mil historias inclusive diseño 3D... es estable, va con un Artic Freezer 360, no hay drama con eso. Hice la prueba antes con CPU por tu post y la verdad que corre un Qwen2.5 que uso como asistente en la terminal, bastante fresco y rápido.


Gafollas
ForoCoches: Miembro
#19
Upeo, que interesa. Intenté montar algo en local para programar (Qwen 3.6) y me iba a pedales, se liaba, perdía el contexto todo el rato... Y creo que mi PC algo podría tirar (32gb de ram, una 3070Laptop), aunque vaya lentillo, pero que sea usable.
Starscream
ForoCoches: Miembro
#20
Cita de Erclon Muska
Con GPU, la diferencia aprox en mi caso es de 20% de Windows a Linux en favor, esto con una 4080. Con mi anterior RX 7900 XT era parecido. Por eso te preguntaba, suele merecer la pena un dual boot para estos menesteres al menos en GPU, puede que en CPU también te merezca la pena.


Puedes vender esas RX 550 y pillar algo como una Mi 50 de 16GB, andan rondando los 100 y pocos. Lo único que tendrías que tirar del backend de Vulkan en Windows, en Linux si podrías usar ROCm... aunque la diferencia a día de hoy en LLM no es mucha con ambos backend.


Curiosamente como modelo estrella ahora, estoy usando un Qwen3.6 también, un Qwen3.6-34B-80L-Fable-5-Heretic.i1-Q4_K_M (de mradermacher). Lo cargo en la RTX 4080 y luego en la Mi 50 de 16GB que tengo en un servidor, uso RPC de llama para cargar capas en esta (tienes que compilarlo con las flags adecuadas para que funcione, ya que es experimental), penaliza un poco en tokens pero corre bien, lanzándolo así:


./llama-server -ngl 99 -m$MODEL --temp 0.0 --top-p 0.95 --top-k 64 --min-p 0.00 --fit on --jinja --flash-attn on --ctx-size 196608 --ctx-checkpoints 256 --cache-ram -1 --cache-type-k q8_0 --cache-type-v q8_0 --threads 8 --threads-batch 16 --no-mmap -np 1 --rpc 192.168.0.2:50052 --tensor-split 55,45 --host 0.0.0.0


El 9800X3D está con PPT, TDC y EDC de origen, +200 de frecuencia, Scalar a 1x (de serie) y Curve Optimizer en bastantes núcleos a -20 y -30, en el más tragón a -15 y el más vago -35. Se ha comido bastantes horas de CoreCycler con bastantes test, juegos y mil historias inclusive diseño 3D... es estable, va con un Artic Freezer 360, no hay drama con eso. Hice la prueba antes con CPU por tu post y la verdad que corre un Qwen2.5 que uso como asistente en la terminal, bastante fresco y rápido.





Menudo monstruo tienes y la configuración superafinada. ¿a que frecuencia y latencia tienes la RAM?


Estos de qwen..desde que se le fue el "chino listo" y se llevo a 3-4 con el, parece que soltaron bastante el pedal de publicar modelos abiertos, un Qwen3.7-80B-A3B me vendria perfecto, el qwen next me flipa el estilo que tiene de escritura y el conocimiento lo bien que lo hilaba...pero segun crecia el contexto la velocidad se hunde en picado, asi que casi no lo uso (ni el qwen coder next) pero para re-redactar textos, informes y mierdas legales,lo tengo en la recamara.
Starscream
ForoCoches: Miembro
#21
Cita de Gafollas
Upeo, que interesa. Intenté montar algo en local para programar (Qwen 3.6) y me iba a pedales, se liaba, perdía el contexto todo el rato... Y creo que mi PC algo podría tirar (32gb de ram, una 3070Laptop), aunque vaya lentillo, pero que sea usable.

Empieza desde abajo con herramientas sencillas y ve subiendo según te enteres más y pilles soltura.


El subredit /localllama y /localllm son los sitios buenos.


Empieza con lm studio y un qwen3.6, ve probando tamaños, configuraciones, toca mucho y lee sin parar, prueba otros modelos más pequeños, más grandes, cuantizaciones, llegaras a tus conclusiones de lo que se ajusta para ti, porque cada uno somos un mundo y nuestros equipos igual.


En 2 semanas eres un pro.
rgparadela
ForoCoches: Usuario
#22
Empieza por modelos ligeros y ve midiendo tiempos de respuesta.
Gafollas
ForoCoches: Miembro
#23
Cita de Starscream
Empieza desde abajo con herramientas sencillas y ve subiendo según te enteres más y pilles soltura.


El subredit /localllama y /localllm son los sitios buenos.


Empieza con lm studio y un qwen3.6, ve probando tamaños, configuraciones, toca mucho y lee sin parar, prueba otros modelos más pequeños, más grandes, cuantizaciones, llegaras a tus conclusiones de lo que se ajusta para ti, porque cada uno somos un mundo y nuestros equipos igual.


En 2 semanas eres un pro.
Gracias por el mensaje shur. Con ese equipo puedo tirar algo decente? Suelo programar en Java cosas relativamente complejas, y no sé si seré capaz de usar algo decente y que vaya más o menos rápido...
EnxebreFC
ForoCoches: Usuario
#24
Para generar código con un mínimo de calidad necesitas al menos 32GB de VRAM y utilizar un modelo en Q8.

Los modelos en Q4 a medida que crece el contexto van arrastrando errores.

Otra cosa es que quieras experimentar con LLMs o no lo quieras para desarrollar código. Con una tarjeta de 16GB VRAM podrías empezar.

Yo personalmente trabajo con dos Radeon R9700 (64GB VRAM) y con menos de 40GB no obtengo resultados de cierta calidad con Qwen3.6 27B Q8.

Aún así, no esperes obtener el resultado de una suscripción a ChatGPT o Claude. Hay mucho ensayo y error, aprender a fragmentar el trabajo, afinar configuraciones de llamacpp, etc.
CibernoX_CTDI
ForoCoches: Miembro
#25
Yo tengo un servidor en casa con 64gb de ram, 8TB de SSD, 20 cores y 2x7900XTX (48gb de vram en total). Más o menos me costó unos 3000€ todo incluido (caja, disipadores, PSU platinum...).

En general, 24gb de vram es lo mínimo que yo recomendaría.
joan16v
ForoCoches: Miembro
#26
yo con la RTX 3080 10GB uso qwen3 8B a diario con ollama


funciona muy bien, fluido
Erclon Muska
Tecnonigromante
#27
Cita de Starscream
Menudo monstruo tienes y la configuración superafinada. ¿a que frecuencia y latencia tienes la RAM?


Estos de qwen..desde que se le fue el "chino listo" y se llevo a 3-4 con el, parece que soltaron bastante el pedal de publicar modelos abiertos, un Qwen3.7-80B-A3B me vendria perfecto, el qwen next me flipa el estilo que tiene de escritura y el conocimiento lo bien que lo hilaba...pero segun crecia el contexto la velocidad se hunde en picado, asi que casi no lo uso (ni el qwen coder next) pero para re-redactar textos, informes y mierdas legales,lo tengo en la recamara.

Si, bueno me he dedicado al montaje en tienda y demás durante unos años, ahora soy Sysadmin pero soy muy maniático con todos los ajustes desde siempre. También hice DAM, pero no me terminó de molar mucho y con la IA tampoco lo ví factible.


Las memorias están a 6000MHz CL30, pero he buscado más ajustar voltajes a la baja que el overclock... tampoco merece la pena apretar al alza, no es tan dependiente de la RAM los X3D. Los tiempos están tal que así:





Yo al principio era muy de usar gemma y DeepSeek, por lo que sea ya no salen tantos nuevos como antes de este último... y gemma están bien, pero tirando con los Qwen, me parece bastante más completos y hay mucho distil de otros modelos con ellos. Ese pequeño de atrás lo uso como asistente de comandos de la terminal y la verdad que para ser pequeño, acierta bastante. Sobretodo cuando me voy de Linux a Windows, recuerdo algo de Linux y no recuerdo como se hace en Win con PowerShell, se lo tiro con un asistente de consola y acierta.


Hoy con tu post, al ver que iba bien en CPU, me lo he llevado al trabajo y ahora lo corro en CPU allí. La tenía muy denostrada a la CPU para estos menesteres, pero va a ser que estaba equivocado. Se aprende mucho en el foro y me alegro de que haya cacharreros, así aprendemos todos

El que comenté atrás es Distil de Fable (el poco tiempo que lo tuvieron funcionando) y es bastante capaz, sobretodo al pedirle cosas poco "'éticas"... pero tienes razón, un 80B sería la hostia. Pero ya hay que invertir más pasta y por ahora, para cosas complejas que no requieran subir doc privada, tengo Gemini Pro gratuito de estudiante. Ya cuando se acabe, veremos por donde vamos...
Starscream
ForoCoches: Miembro
#28
Cita de EnxebreFC
Para generar código con un mínimo de calidad necesitas al menos 32GB de VRAM y utilizar un modelo en Q8.

Los modelos en Q4 a medida que crece el contexto van arrastrando errores.

Otra cosa es que quieras experimentar con LLMs o no lo quieras para desarrollar código. Con una tarjeta de 16GB VRAM podrías empezar.

Yo personalmente trabajo con dos Radeon R9700 (64GB VRAM) y con menos de 40GB no obtengo resultados de cierta calidad con Qwen3.6 27B Q8.

Aún así, no esperes obtener el resultado de una suscripción a ChatGPT o Claude. Hay mucho ensayo y error, aprender a fragmentar el trabajo, afinar configuraciones de llamacpp, etc.

Trae usted verdades como puños, hay que dar mucha vuelta...y la cuantización Q4_K_M en contexto largo, acaba rompiendo costuras.


En reddit dicen (yo no lo comprobe) que los modelos de más parametros totales y activados, aguantan mejor las cuantizaciones algo más agresivas.
Shurpira
Cuota pagada ✔
#29
No, pero si uno pequeño en una raspberry
Starscream
ForoCoches: Miembro
#30
Cita de Erclon Muska
Si, bueno me he dedicado al montaje en tienda y demás durante unos años, ahora soy Sysadmin pero soy muy maniático con todos los ajustes desde siempre. También hice DAM, pero no me terminó de molar mucho y con la IA tampoco lo ví factible.


Las memorias están a 6000MHz CL30, pero he buscado más ajustar voltajes a la baja que el overclock... tampoco merece la pena apretar al alza, no es tan dependiente de la RAM los X3D. Los tiempos están tal que así:





Yo al principio era muy de usar gemma y DeepSeek, por lo que sea ya no salen tantos nuevos como antes de este último... y gemma están bien, pero tirando con los Qwen, me parece bastante más completos y hay mucho distil de otros modelos con ellos. Ese pequeño de atrás lo uso como asistente de comandos de la terminal y la verdad que para ser pequeño, acierta bastante. Sobretodo cuando me voy de Linux a Windows, recuerdo algo de Linux y no recuerdo como se hace en Win con PowerShell, se lo tiro con un asistente de consola y acierta.


Hoy con tu post, al ver que iba bien en CPU, me lo he llevado al trabajo y ahora lo corro en CPU allí. La tenía muy denostrada a la CPU para estos menesteres, pero va a ser que estaba equivocado. Se aprende mucho en el foro y me alegro de que haya cacharreros, así aprendemos todos

El que comenté atrás es Distil de Fable (el poco tiempo que lo tuvieron funcionando) y es bastante capaz, sobretodo al pedirle cosas poco "'éticas"... pero tienes razón, un 80B sería la hostia. Pero ya hay que invertir más pasta y por ahora, para cosas complejas que no requieran subir doc privada, tengo Gemini Pro gratuito de estudiante. Ya cuando se acabe, veremos por donde vamos...



Fino fino ese equipo, si señor.


Esto de los MoE se lo inventaron los chinos para no tener dependencia tecnologica con las gpu's que las suyas aun estan muy verdes pero les permite correr modelos medianos en x86, arm, risc-v y lo que sea.




Dejo por aqui mi colección de llm's (es lo que uso para ligar: "oye juapa, quieres subir a que te enseñe mi coleccion de ia's locales, XD"), por si le sirve alguien de inspiración y/o cacharreo.








Aunque no lo use para inferenciam pero para descargar, hacer las pruebas, añadir, borrar, es una herramienta supercomoda.


El baidu ernie es lo mejor que encontre para hacer inferencia por cpu con solo 16GB de ram, con una distro dietpi de base, 2 paquete que instalas y el llama cpp, entra sin problemas, habla español pero es mejor operar con el solo en inglés, por que chino pues no.
https://dietpi.com/


Estos 3 que los tengo de backup en un hdd externo para hacer consultas medicas, si, eso que se supone que no hay que hacer y es peligrosisimo...pero no me fio tampcoo de los medicos viejos, de que no sean el expendiente, de que se pasaran la carrera de farra o de que los traigan de fueran que a saber si pagaron el titulo.


El medgemma-27b-it, qCammel-13 y el /Baichuan-M2-32B


Pille la inspiración de aquí, no publi:

https://dr7.ai/models


Siempre en la mayor cuantizacion posible, no son MoE, me tiran por cpu lento lento lento, pero lo uso en plan oraculo, les tiro el tocho de texto bien redactado con sintomas, datos, sensaciones, pruebas y les pido diagnostico primario, secundario, medicación dosis y a las 2 horas esta la respuesta.
Contentisimo al menos para lo tipico que acabe cogiendo en las 2 ultimas navidades de resfriados y tal.




Igual es que estoy mal de la cabeza, pero a mi como informatico, en lo mio, me ayudan, me descargan a lo minion, o me resuelven alguna duda puntual, pero el que manda y parte el bacalao soy yo.
El tener uno que me hace de medico, sin ser yo medico, me parece una puta maravilla


Ojala puediera encontrar alguno o alguien dejarlo caer, experto en leyes españolas con todo el corpus legal, con los boes y reglamentos metidos dentro, para ahorrar tambien abogados, cosas de la aburrida vida adulta española.


Si no tienes en la familia o amigos, un medico o un abogado, vas jodido y te toca pagar, mientras tanto..a los informaticos nos intenta ningunear pagando migajas.


Perdon por el offtopic.
← A Electrónica / Informática
Amazon
Nuevas ofertas cada día