Installer Google Gemma 4 IA offline og gratis på telefonen

Indeks
  1. Gemma 4 og forskellene mellem modellerne E2B, E4B, 26B og 31B
  2. Hvordan man bruger Google Gemma-modeller på Android
    1. Den officielle vej til Google AI Edge Gallery
  3. Bring AI uden internet på iPhone og iPad
  4. Begrænsninger og advarsler til hverdagsbrug

Installer Google Gemma 4 på din smartphone for at bruge potentielt kraftfuld AI offline, med fokus på privatliv og minimal ressourceforbrug.

Da jeg forsøgte at installere Gemma 4 på min smartphone til 400 Euro, viste det sig, at det fungerer fremragende som en offline AI. Jeg vil understrege, hvor enkelt og fordelagtigt det er. At sende følsomme oplysninger til tredjeparters servere som Google er ikke den eneste måde at bruge AI på. Takket være kraften i de neurale processorer i moderne smartphones, selv middelklasse-modeller, kan vi bearbejde oplysningerne autonomt.

At køre en model lokalt forvandler telefonen til en ægte uafhængig beregningsmotor. Google har for nylig udgivet familien Gemma 4 under åben licens, hvilket introducerer indfødte multimodale evner. Dette betyder, at vi kan bearbejde komplekse tekster og genkende elementer i fotografier helt uafhængigt af nettet.

Den reelle fysiske hindring er systemets hukommelse. For at undgå total nedlukning af enheden kræves det både hardware med et godt hukommelsesforbrug og en optimeret AI-model. Denne Gemma-model fra Google, open source, er tilgængelig i en lettere version, som alle kan bruge gratis.

I en anden artikel har vi set hvordan man installerer Gemma LLM på PC, nu skal vi se, hvordan man gør det samme på en smartphone, hvilket er super nemt, hvis vi har en Android-telefon, med lidt mere teknisk arbejde, hvis vi vil bruge en iPhone.

Gemma 4 og forskellene mellem modellerne E2B, E4B, 26B og 31B

Gemma 4 er en open source-model fra Gemma-familien, designet til at fungere direkte på smartphones, tablets og laptops uden at støtte sig til skyen, som Gemini eller chatGPT gør. Den håndterer tekst, billeder, video og lyd med en overraskende lethed, takket være Per-Layer Embeddings (PLE), som reducerer hukommelsesforbruget til 2-3 GB. Dette gør den også anvendelig for ældre enheder.

Det er en chatbot, der ligner ChatGPT, som fungerer offline, gratis og uden begrænsninger, sikrer privatliv og hurtig reaktionsevne og udmærker sig ved en effektivitet på 90% i opgaver som billedgenkendelse eller lydtransskription.

Linjen Effective 2B og Effective 4B er præcist ingeniørarbejdet til mobilsektoren. Disse algoritmer bruger få ressourcer, håndterer lange tekster og processerer billeder hurtigt. De er den obligatoriske valg til daglig brug på smartphones.

Når man bevæger sig op i niveau, møder man modellen 26B MoE, som er baseret på en ekspertarkitektur, der kun aktiverer en del af sine milliarder af parametre ad gangen for at maksimere reaktionsevnen. Det krævede plads for at opbevare den overskrider kapaciteten af nutidens telefoner, hvilket gør den til et produkt, der er beregnet til bærbare computere.

Den enorme 31B Dense repræsenterer den logiske maksimumsevolution af serien. At forsøge at installere den på en touchskærm er en urimelig handling. Den termiske overophedning ville blokere kredsløbene på få minutter, og genereringen af de enkelte ord ville ske med en frustrerende langsomhed.

Modellerne Gemma 26B og 31B kan prøves og anvendes frit og uden begrænsninger fra Google AI Studio.

Hvordan man bruger Google Gemma-modeller på Android

Android-operativsystemet giver frihed til at manipulere systemfiler. For at få processoren til at kommunikere med de downloadede data kræves der en optimeret interface, men man skal træde uden for de trygge rammer i Play Store.

Der er to, faktisk tre måder at installere Gemma på Android:

Den første er MLC LLM. Installationspakken findes ikke i de traditionelle kommercielle kredsløb og kræver manuel handling.

  • Download filen med APK-udvidelsen direkte fra den angivne officielle portal.
  • Start installationen ved at give Android tilladelse til ukendte kilder.
  • Åbn programmets bibliotek for at browse de pakker, der er kompatible med Gemma 4-serien.
  • Vælg en komprimeret variant til 4-bit for ikke at overbelaste chippen.
  • Vent på redningen og begynd at skrive.

Hvis vi foretrækker at bevare kontrollen over de pakker, der downloades fra andre platforme, kan vi stole på Layla, der er tilgængelig til Android og iPhone. Dette miljø understøtter direkte import af GGUF-filer, det nuværende standardformat til offline behandling, delt af hele fællesskabet af entusiaster.

For udviklere og kodepurister administrerer det californiske firma Google AI Edge Gallery. Det er ikke en digital butik åben for offentligheden, men en teknisk samling, hvor de native filer og grundbiblioteker distribueres.

Hele infrastrukturen er bygget på MediaPipe, et framework, der omgår cloud-servere for at behandle signaler direkte på enheden.

For at bringe Gemma 4 til Android, skal man bruge appen Google AI Edge Gallery, som kan downloades fra GitHub, hvor den nyeste version af filen ai-edge-gallery.apk kan hentes. Android kan vise en sikkerhedsadvarsel, fordi vi ikke installerer en app fra Google Play Butik, men der er ingen risici, da det er en officiel app, så tryk “Fortsæt” og derefter “Installer”.

Appen åbner med en ren og meget simpel grænseflade, hvor du blot skal trykke på en af ​​knapperne og vælge den Gemma-model, du vil downloade, afhængigt af hvor meget plads du har i telefons hukommelse. Den største og mest kraftfulde model er gemma-4-E4B-it-int4.task, som fylder 4 GB, derefter har vi gemma-4-E2B-it-int4.task (mere letvægts, cirka 2 GB RAM), mens den minimale model kun vejer 500 MB, selvom den er meget essentiel.

For at downloade modellen forbinder AI Edge Gallery-appen til Hugging Face-siden, hvor du skal oprette en gratis konto. Når du har givet tilladelserne (vær opmærksom på, at accept-knappen skal scroller lidt ned på siden), kan du fortsætte med at downloade filen tar.gz, som anerkendes af appen.

Hvis det er nødvendigt, i Google AI Edge Gallery, tryk på “+” nederst til højre, vælg den downloadede fil, aktiver derefter Support image og GPU (hvis tilgængelig) og klik “Importer”.

Du kan så chatte frit med Google AI Gemma, selv uden internetforbindelse, på italiensk.

Bring AI uden internet på iPhone og iPad

På iOS sætter Apples lukkede miljø meget strenge restriktioner for indsættelse af ekstern kode. A- og M-seriens chips fungerer dog fremragende med tensor-beregninger og tilbyder ofte en flydende oplevelse, der er bedre end modparten.

Vi kan udnytte fundamenterne i MLC-projektet, men med et andet udseende. På Apples App Store kaldes applikationen MLC Chat. I dette tilfælde sker download officielt, og algoritmevalget styres fra hovedgrænsefladen.

I perioder med stor innovation, for at teste eksperimentelle neurale netværk, tvinger udviklerne overgangen gennem TestFlight-miljøet. Denne proces kræver installation af Apples beta-hub for derefter at låse softwaren via de invitation-links, der offentliggøres på GitHub.

Et mere essentielt alternativ, dedikeret til mere erfarne brugere, er LLM Farm. Opsætningen kræver, at du placerer den elektroniske hjerne i iCloud eller i den interne hukommelse for derefter at knytte den til appens kommandoer.

For at opnå maksimal fluiditet på Cupertino-enhederne, anbefaler vi at deaktivere alle energibesparende funktioner og tvinge lukningen af alle programmer i baggrunden. Udførelsen af neurale netværk kræver øjeblikkelig adgang til alle tilgængelige ressourcer uden flaskehalse.

Begrænsninger og advarsler til hverdagsbrug

At holde et så massivt program kørende rejser spørgsmål om ressourceforbrug og privatlivsforvaltning. Lad os opsummere de grundlæggende koncepter, der skal huskes først.

  • Ekstremt batteriforbrug. Lokal behandling presser komponenterne til deres termiske grænse og dræner strømmen meget hurtigere end et almindeligt 3D-videospil.
  • Absolut privatlivsgaranti. Ingen indtastet tekst, lydfiler eller fotografier passerer gennem telefonens modem. Total isolation gør hver enkelt interaktion anonym.
  • Ingen genopretning af cloud-plads. For at kommunikere med assistenten skal man give afkald på adskillige gigabyte fast hukommelse for at gemme neurale biblioteker på sin interne lagring.
  • Håndtering af overophedning. At føle bagsiden af enheden blive meget varm er en fysiologisk adfærd, da transistorerne arbejder under konstant belastning for at behandle logikken i sætningerne.
  • Interaktion med kameraet. Den multimodale struktur gør det muligt at pege objektivet på et virkeligt objekt og modtage en præcis beskrivelse, helt uafhængigt af dataforbindelsens tilstand.

Skriv et svar

Din e-mailadresse vil ikke blive publiceret. Krævede felter er markeret med *

Go up