- Pagpapatupad ng pribadong kapaligiran ng AI gamit ang Ollama at ang extension na Continue.
- Paggamit ng mga espesyal na modelo tulad ng Qwen2.5-Coder upang balansehin ang lakas ng chat at bilis ng autocomplete.
- Paghahambing sa pagitan ng ecosystem ng mga solusyong nakabatay sa cloud at soberanya ng data sa mga lokal na server.
Sa mga panahong ito, halos lahat ng nagpo-program ay sumubok na ng ilang AI tool para matulungan sila. Ang mga solusyon tulad ng GitHub Copilot o Cursor ay mahusay dahil nagmumungkahi ang mga ito ng buong bloke ng code sa isang kisap-mata. Gayunpaman, may isang mahalagang detalye na hindi natin maaaring balewalain : para gumana ang mga tool na ito, ang iyong code ay karaniwang naglalakbay sa mga panlabas na server, na maaaring maging isang malubhang problema kung nagtatrabaho ka sa mga kumpidensyal na proyekto o sa ilalim ng mahigpit na mga kasunduan sa privacy.
Ang magandang balita ay hindi mo na kailangang ibenta ang iyong kaluluwa sa diyablo o magbayad ng buwanang subscription para magkaroon ng isang makapangyarihang katulong. Posible na ngayong mag-set up ng isang autocomplete at pribadong chat system gamit ang mga open-source na template, isang disenteng graphics card, at ilang libreng tool. Kaugnay nito, titingnan natin kung paano lumikha ng isang workflow na walang ibang nakadepende kundi ang iyong sariling hardware.
Copilot laban sa soberanya ng mga lokal na modelo
Kung ikukumpara natin ang serbisyo ng GitHub sa isang pasadyang solusyon, ang pangunahing pagkakaiba ay ang kontrol. Bagama't napakadaling i-install at handa nang gamitin ang Copilot, nangangahulugan ito na ang iyong data ay umaalis sa iyong lokal na network at magbabayad ka ng bayad kung hindi ka isang estudyante o hindi nagpapanatili ng mga open-source na proyekto. Sa kabilang banda, ang isang lokal na stack ay nag-aalok sa iyo ng kumpletong kontrol sa modelo at kabuuang privacy ng iyong code.
Gayunpaman, huwag nating lokohin ang ating mga sarili: ang pag-set up ng sarili mong server ay hindi nangangahulugang libre ang lahat. Kailangan mong isaalang-alang ang paunang gastos ng mga bahagi at ang konsumo ng kuryente sa pagpapatakbo ng isang GPU. Hindi namin nilalayon na gayahin ang bawat tampok ng bersyon ng Microsoft Enterprise, kundi upang matugunan ang pang-araw-araw na pangangailangan ng isang developer nang hindi umaalis ang data sa imprastraktura ng kumpanya o tahanan.
Teknikal na arkitektura at mga pangunahing kinakailangan
Ang proseso ay medyo linear at lohikal. Sa madaling salita, kinukuha ng VS Code ang konteksto ng code at ipinapadala ito sa extension na Continue . Ang Continue ay nagsisilbing tulay o tagapamagitan na nakikipag-ugnayan kay Ollama , ang engine na responsable sa pagpapatakbo ng mga espesyal na modelo ng programming language sa iyong sariling makina.
Para matiyak na maayos itong tumatakbo, kakailanganin mo ng naka-install na Visual Studio Code at isang server na nagpapatakbo ng Ollama. Lubos na inirerekomenda ang isang modernong GPU na may sapat na VRAM at 10-15 GB na libreng espasyo sa disk. Higit sa lahat, hindi mo na kailangang magparehistro sa anumang platform o gumawa ng anumang kahina-hinalang account.
Hakbang-hakbang na gabay: Pag-install at mga modelo
Para makamit ang pinakamahusay na pagganap, ang sekreto ay huwag gumamit ng iisang modelo para sa lahat. Sa isip, dapat mong paghiwalayin ang mga gawain sa chat mula sa mga gawaing autocomplete. Para sa malalim na pagsusuri at chat, maaari mong gamitin ang qwen2.5-coder:7b o kahit 14b kung mayroon kang higit sa 12 GB ng VRAM. Ang mga modelong ito ay mas mabagal ngunit mas matalino.
Para sa autocomplete, na siyang lumalabas habang nagta-type ka, kailangan natin ng isang bagay na agad-agad. Doon papasok ang usapin. qwen2.5-coder:1.5bDahil mas magaan, pinapayagan nito ang mga mungkahi na dumaloy nang walang lag. Kapag na-download na gamit ang command ollama pullMaaari nating patunayan na gumagana ang mga ito sa pamamagitan ng pagpapatakbo ng isang simpleng ollama list Sa terminal.
Kung ang iyong Ollama server ay nasa ibang makina kumpara sa kung saan ka nagpo-program, tandaan na bilang default ay nakikinig lamang ito sa localhost. Para ayusin ito, kailangan mong i-edit ang configuration ng serbisyo sa Ubuntu gamit ang [method/method]. sudo systemctl edit ollama at idagdag ang variable ng kapaligiran OLLAMA_HOST=0.0.0.0:11434Pagkatapos i-restart ang serbisyo, suriin ang koneksyon mula sa iyong PC gamit ang curl upang matiyak na hindi hinaharangan ng firewall ang koneksyon.
Ipagpatuloy ang mga setting sa Visual Studio Code
Ang Continue ay marahil ang pinakamatibay na extension para sa pagkonekta ng mga lokal na modelo. Hanapin lamang ito sa extensions marketplace, i-install ito, at i-restart ang editor. Kapag lumabas na ang icon sa sidebar, pumunta sa Local Config at i-edit ang config.yaml file upang sabihin dito kung saan eksaktong matatagpuan ang iyong AI server.
Sa file na ito, kailangan nating tukuyin ang mga modelo. Para sa chat, kino-configure natin ang 14B model at binibigyan ito ng isang partikular na systemMessage upang mapanatili itong direkta at maiwasan ang mga hindi kinakailangang paliwanag. Para sa autocomplete, itinatalaga natin ang 1.5B model. Sa pamamagitan ng pag-save ng mga pagbabago, alam na ngayon ng VS Code kung aling modelo ang itatanong sa bawat oras na magsusulat tayo ng isang linya ng code.
Pagsubok sa lokal na katulong
Para matiyak na halos perpekto ang lahat, mainam na gumamit ng script na may mga karaniwang error: mga hindi pa naisasagawang variable, mga hindi napapanahong pagkakadugtong ng string, o mga typo. Sa pamamagitan ng pagpili sa code at pagpindot sa Ctrl+L , susuriin ng mas malaking modelo ang napili at magmumungkahi ng mga pagpapabuti. Ang pinakamadaling paraan ay ang paggamit ng button na Ilapat upang palitan ang lumang code ng bago nang hindi kinakailangang manu-manong kopyahin at i-paste.
Para sa autocomplete, simulan lang ang pag-type ng bagong function. Pagkatapos ng ilang sandali, makikita mo ang tekstong naka-highlight sa kulay abo, na nagmumungkahi ng iba pang lohika. Kung tama ang mungkahi, pindutin lamang ang Tab key. Kung mapapansin mong hindi ito tumutugon, ang mabilisang solusyon ay i-restart ang extension host mula sa developer command palette.
Iba pang mga alternatibo at ang ekosistema ng AI
Kung sa ilang kadahilanan ay hindi ka nagustuhan ng pamamaraan ni Ollama, may iba pang mga opsyon sa merkado. Mayroon ang Amazon ng CodeWhisperer , na napakalakas, lalo na para sa Java at Python. Para sa mga naghahanap ng mas nakabatay sa komunidad, ang Captain Stack ay isang kawili-wiling tool na gumagamit ng mga resulta ng Stack Overflow sa halip na isang purong neural network.
Mayroon din kaming mga tool tulad ng Kite , na nakatuon nang husto sa Jupyter Lab, o sa AlphaCode ng Google , na idinisenyo para sa mga kompetitibong programming. Mayroon pang mas simpleng mga opsyon tulad ng Clara Copilot. Gayunpaman, wala sa mga ito ang nag-aalok ng privacy at customization na ibinibigay ng Continue at Ollama combo, na tumatakbo sa sarili mong GPU.
Makatotohanang mga inaasahan at pagganap
Mahalagang huwag magpadala sa hype at unawain na ang isang 7B o 14B na modelo ay hindi makakatalo sa mga higanteng cloud sa mga napakakumplikadong gawain sa arkitektura. Bukod pa rito, ang pag-index ng malalaking repositoryo ay maaaring kumonsumo ng malaking halaga ng RAM sa simula. Sa huli, ang pangwakas na kalidad ay palaging nakasalalay sa lakas ng iyong graphics card.
Kung mayroon kang 12GB RTX 3060, magiging napakaganda ng karanasan. Ngunit kung mag-a-upgrade ka sa 24GB RTX 4090 , ang performance ay magiging propesyonal, na may halos agarang mga tugon sa chat. Sa anumang kaso, para sa pang-araw-araw na pag-develop, unit testing, at dokumentasyon, ang solusyon na ito ay higit pa sa mapagkumpitensya.
Matapos suriin ang lahat ng mga opsyon, malinaw na maaari na tayong lumipat mula sa mga serbisyo ng subscription patungo sa isang mas praktikal na kapaligiran. Kung iko-configure man ang Ollama gamit ang mga modelo ng Qwen para sa kumpletong privacy o mga tool sa pagsubok tulad ng CodeWhisperer, ang AI ay naging kanang kamay ng programmer. Sa huli, ang mahalaga ay ang paghahanap ng balanse sa pagitan ng pagganap, gastos, at seguridad ng data upang gawing maayos ang daloy ng trabaho hangga't maaari.
