Jakich lokalnych modeli używacie do programowania?

Jakich lokalnych modeli używacie do programowania?
kzkzg
  • Rejestracja: dni
  • Ostatnio: dni
  • Postów: 939
0

Jaki model, jaki sprzet, setup, settingsy itd.

AN
  • Rejestracja: dni
  • Ostatnio: dni
1

Sprzęt:

Komputer Lenovo Legion Y520T
Płyta: Legion Y520T-25IKL / 36D9
Procesor: Intel(R) Core(TM) i5-7400 CPU @ 3.00GHz
Pamięć RAM: 32GB
Grafika wbudowana: Intel Corporation HD Graphics 630
Grafika na PCI-E: Gigabyte GeForce RTX 3090 Gaming OC 24GB GDDR6X
Dysk SSD: WDC PC SN520 SDAPNUW-512G-1014
Dyski SATA: 2x SAMSUNG HD103SJ (1AJ10001) 1TB
Zasilacz: Be Quiet! Pure Power 12 850W 80 Plus Gold
System: Ubuntu Linux 20.04

Serwer LLM: Ollama.

Klient LLM: Sam porgram Ollama uruchomiony poleceniem ollama run nazwamodelu lub mój własny https://github.com/andrzejlisek/ConChat równie dobrze może być dowolny inny program do pogawędki z LLM.

Modele, wszystkie z biblioteki Ollama:
qwen3:32b-q4_K_M
gemma3:27b-it-qat
gpt-oss:20b
command-r:35b-08-2024-q4_K_M

To są modele ogólnego użytku, na moje potrzeby wystarczają, one i tak dużo miejsca zajmują. Czesto modele wiedzą, jak rozwiązań problem, gdzie jakiś kod nie kompiluje się lub nie działa, a także zna odpowiedź na pytanie o podstawy typu "jak otworzyć plik tekstowy w Rust" lub "jak zamienić tekst na liczbę w Rust".

Ze względu na ograniczone miejsce na dysku, modeli "coder" nie testowałem.

Przy doborze modeli kieruję się zasadą: Kwantyzacja co najmniej q4_K_M, wielkość modelu maksymalnie 21GB, aby w całości wszedł do karty graficznej.

Mendoza
  • Rejestracja: dni
  • Ostatnio: dni
  • Lokalizacja: Warszawa
3

Mac Mini M4 Pro 64GB

Ostatnio męczyłem lokalnie qwen3.6:27b-coding-nvfp4 przez ollama w opencode oraz Cline.

Nawet dawało radę na moje potrzeby. Oczywiście nie działa to tak szybko jak modele chmurowe i zazwyczaj na noc zapuszczałem agenta, bo musiałem zbyt długo czekać na wyniki.

JT
  • Rejestracja: dni
  • Ostatnio: dni
  • Postów: 38
0

Ja na swoim dedykowanym Minisforum MS-S1 MAX uzywalem do tej pory qwen3.6:27b na zdokeryzowanej Ollama'ie.
Dzisiaj jednak zwrocilem uwage na robit/ornith:35b i po wstepnych probach wydaje sie byc zauwazalnie lepszy.
BTW, polecam opencode. Wymiata.

kimikini
  • Rejestracja: dni
  • Ostatnio: dni
7

nie uzywam lokalnych bo to by wymagalo duzej inwestycji z mojej strony (na pewno ponad 100k) zeby to mialo sens. totalnie sie nie oplaca

JT
  • Rejestracja: dni
  • Ostatnio: dni
  • Postów: 38
0
Mendoza napisał(a):

Mac Mini M4 Pro 64GB
Ostatnio męczyłem lokalnie qwen3.6:27b-coding-nvfp4 przez ollama w opencode oraz Cline.
Nawet dawało radę na moje potrzeby. Oczywiście nie działa to tak szybko jak modele chmurowe i zazwyczaj na noc zapuszczałem agenta, bo musiałem zbyt długo czekać na wyniki.

Jesli nie masz problemu z zapuszczaniem na noc agenta, a chcialbys miec lokalna instalacje modelu porownywalnego z Opus-4.8, to stanowczo powinienes tutaj zerknac: GLM-5.2

Wolne jak cholera 0.3-1.1 tok/s ale masz praktycznie za darmo Opus-4.8

andrzejklusiewicz
  • Rejestracja: dni
  • Ostatnio: dni
  • Lokalizacja: Warszawa
  • Postów: 34
1

U mnie do kodu lokalnie najlepiej sprawdzają się modele "coder", nie ogólnego użytku — przy tej samej wadze potrafią zauważalnie więcej. Konkretnie:

  • qwen2.5-coder — w wariantach 7B / 14B / 32B zależnie od VRAM. Na 24 GB (Twoja 3090) spokojnie wchodzi qwen2.5-coder:32b w q4_K_M i to jest obecnie chyba najlepszy stosunek jakość/sprzęt do kodu, jaki da się odpalić w domu.
  • deepseek-coder-v2:16b — lżejszy, szybki, dobry pod autouzupełnianie.
  • do codziennego "wyjaśnij/popraw ten fragment" wystarcza 14B i jest znacznie szybszy niż 32B.

Setup: Ollama jako serwer + Continue.dev jako wtyczka do VS Code (autocomplete + chat na lokalnym modelu, bez wysyłania kodu do chmury). Zasada doboru jak u @andrzejlisek — kwantyzacja min. q4_K_M i model ma się zmieścić w VRAM, inaczej część ląduje na CPU i robi się wolno.

Robiłem swego czasu porównanie 6 modeli pod różne zastosowania (kod, RAG, ogólne, multimodalne) — wnioski i przykłady tu: https://blog.jsystems.pl/show_post/najciekawsze-modele-na-ollamie-do-roznych-zastosowan/

A jak ktoś dopiero zaczyna z Ollamą (instalacja, pobieranie modeli, API, podpięcie pod własną aplikację) — osobny tutorial od zera: https://blog.jsystems.pl/show_post/ollama_lokalne_modele_llm_tutorial/

Zarejestruj się i dołącz do największej społeczności programistów w Polsce.

Otrzymaj wsparcie, dziel się wiedzą i rozwijaj swoje umiejętności z najlepszymi.