Gemini-verktygslåda: allt du kan göra idag med Googles AI-appar, verktyg och API

Senaste uppdateringen: 25 mars 2026
Författare: Andy Green
  • Gemini's verktygslåda kombinerar stabila verktyg som Canvas, Deep Research och Guided Learning med experimentella Labs-funktioner.
  • Gemini API låser upp multimodala och funktionsanropande arbetsflöden i Google Workspace och anpassade automatiseringar.
  • Guidad inlärning, Canvas och agenter gör Gemini till både en personlig handledare och en arbetsassistent för dokument, bilder och e-post.
  • Med hjälp av Labs, Gemini Enterprise och Workspace-integration kan team testa kraftfull AI säkert ovanpå sina egna data.

Gemini verktygslåda koncept

”Gemini-verktygslådan” är inte längre bara ett fängslande uttryck; det är den praktiska uppsättningen appar, verktyg, agenter och API:er som Google i tysthet väver in i allt från vardagligt lärande till företagsarbetsflöden. Istället för en enda monolitisk assistent beter sig Gemini nu mer som en verktygslåda där varje funktion är ett specifikt instrument: forskningsmotor, handledare, kodhjälpare, mötesschemaläggare, bildskapare och mycket mer.

Om du förstår hur dessa delar hänger ihop – Canvas, guidad inlärning, labb, agenter, Gemini Enterprise och Gemini API – kan du förvandla Gemini till en riktig arbetshäst istället för en nyskapande chatbot. Nedan hittar du en detaljerad genomgång av den här verktygslådan: vad som finns i det stabila "Verktyg"-området, vad som testas i "Labs", hur Gemini beter sig som en handledare med bilder och videor, och hur utvecklare kan koppla API:et till Google Workspace för seriös automatisering.

Vad finns egentligen i Gemini-verktygslådan idag?

Gemini förstås bäst som en familj av AI-modeller ( vad är språkmodeller ) (Gemini 1.0, Gemini 1.5, Gemini 3 och så vidare) som levereras via olika front-end: webb, mobilappar, Workspace-integration och ett utvecklar-API. Idén med "verktygslåda" kommer från hur Google nu grupperar konkreta funktioner i Gemini-gränssnittet, särskilt på webben.

På webben är huvudväljaren i Gemini uppdelad i två huvudzoner: "Verktyg" för stabil, produktionsklar funktionalitet och "Lab" för experiment som fortfarande är under utveckling. Tänk på "Verktyg" som den pålitliga skruvmejseln du tar varje dag, medan "Lab" är facket där du förvarar prototyper som kan ändra form nästa vecka.

På mobilen lägger Gemini-appar till många av samma verktyg – guidad inlärning, Canvas-liknande upplevelser och bildrik hjälp – men de lanseras gradvis. Om du inte ser en specifik funktion i appen ännu rekommenderar Google uttryckligen att du försöker igen senare eller går till gemini.google.com för att se den senaste versionen på webben.

Under huven stöds alla dessa ytor av Gemini API, som exponerar multimodala modeller och funktionsanrop så att du kan generera innehåll, analysera bilder eller orkestrera arbetsflöden genom kod. Det API:et är ryggraden för många av de Workspace-automatiseringar som vi kommer att gå igenom senare.

Gemini-verktyg och funktioner

Verktyg kontra labb: hur Gemini organiserar sina funktioner

I takt med att Gemini har fått fler knappar och lägen har Google infört en tydligare åtskillnad mellan mogna funktioner och experimentella genom två avsnitt: "Verktyg" och "Labs". Denna förändring är redan synlig i webbgränssnittet och distribueras successivt från Googles servrar, så alla konton ser inte samma layout samtidigt.

I avsnittet ”Verktyg” parkerar Google funktioner som de anser vara stabila och förutsägbara för daglig användning. Rapporter från källor som Android Police och 9to5Google visar att detta område inkluderar funktioner som djup research, bildgenerering, videoskapande via Veo, Canvas, guidad inlärning och djupt tänkande, ibland kopplade till specifika prenumerationsnivåer som Google AI Pro eller Google AI Ultra.

”Labs” är å andra sidan den explicita lekplatsen: ett dedikerat område inuti Gemini-väljaren som grupperar funktioner markerade som experimentella. Du ser vanligtvis ikoner med en liten labbkolv och etiketter som Gemini Agent, Dynamisk vy (även kallad visuell layout) och Personlig intelligens. Förväntningen när du klickar på något under Labs är enkel: beteendet kan ändras, försvinna eller flyttas med liten förvarning.

Ur ett produktdesignperspektiv är denna separation viktig för förtroendet. När en AI-app växer snabbt är risken inte bara "för många funktioner" utan "ingen aning om vilka funktioner jag kan lita på". Genom att placera dagliga verktyg i en zon och experiment i en annan signalerar Gemini risk på ett sätt som liknar "normalt" kontra "sport"-läge i en bil.

De stabila Gemini-verktygen: Djupgående forskning, Canvas, Guidad inlärning och mer

Gemini-verktygslådan för de flesta användare finns under "Verktyg", där du hittar de upplevelser som Google vill att du ska bygga vanor kring. Även om den exakta uppställningen varierar beroende på konto och prenumerationsnivå, är några element redan centrala.

Deep Research förvandlar Gemini till en strukturerad forskningsassistent snarare än en generisk chattmodell. När du ställer en fråga som kräver att du går igenom flera källor följer Deep Research en mer explicit flerstegsprocess, vilket ger en konsekvent metod så att användarna vet vad de kan förvänta sig varje gång de använder den.

Verktyg för innehållsskapande för bilder och video – inklusive integrationer från Veo – finns också i verktygslådan. Användare som förlitar sig på Gemini för visuellt innehåll behöver att dessa funktioner är lätta att hitta och någorlunda stabila, inte dolda bakom skiftande experimentella flaggor.

Canvas är ytterligare en pelare: ett arbetsyteläge där du kan starta ett dokument eller kodningsprojekt direkt från en prompt och sedan iterativt förfina det med Gemini. Under förfrågningsfältet kan du välja "Canvas" och skriva din prompt för att generera en startpunkt för innehåll eller kod, och sedan fortsätta redigera i en interaktiv layout sida vid sida.

Guidad inlärning och djupt tänkande kompletterar de mer kognitivt fokuserade verktygen, särskilt för användare som vill ha strukturerad hjälp med komplexa ämnen. Guidad inlärning kan fungera som en handledare som går igenom idéerna steg för steg, medan djupt tänkande uppmuntrar till långsammare, mer avsiktligt resonemang kring utmanande frågor.

Gemini som personlig handledare: Guidad inlärning, bilder och videor

En av de mest användarvänliga aspekterna av Gemini-verktygslådan är dess förmåga att fungera som en privatlärare, där man blandar guidade sekvenser med visuella förklaringar. Istället för att dumpa en vägg av text kan Gemini integrera bilder, skisser och till och med videor i sina svar för att göra koncept lättare att förstå.

Rent praktiskt kan du be Gemini att förklara ett ämne och uttryckligen begära ett diagram, en visuell sammanfattning eller en illustrativ bild. Svaret kan bädda in dessa bilder direkt i förklaringen, vilket hjälper dig att visualisera, till exempel, ett matematiskt koncept, ett arbetsflöde eller en vetenskaplig process.

Videobaserad inlärning stöds också, även om detaljerna varierar beroende på region och utrullningsfas. För vissa ämnen kan Gemini visa eller referera till videor som kompletterar dess textbaserade svar, vilket skapar en mer multimodal inlärningsväg där du läser, tittar på och interagerar med frågor i samma flöde.

Detta inlärningsläge introduceras gradvis i Gemini-mobilapparna, så du kanske inte ser alla alternativ direkt. När det händer är reserven att använda webbupplevelsen, där Geminis funktioner ofta visas tidigare under etappvisa utrullningar.

Gemini Enterprise och Workspace: AI-agenter för team

Utöver personligt bruk sträcker sig Gemini-verktygslådan till arbetsplatsen genom integrationer med Gemini Enterprise och Google Workspace. Här flyttas fokus från engångsförfrågningar till beständiga agenter, arbetsflöden och samarbete i stor skala.

Gemini Enterprise beskrivs av Google som en avancerad agentplattform som ger det bästa av Googles AI till varje anställd och arbetsflöde. I praktiken låter den team upptäcka, skapa, dela och köra AI-agenter i en säker miljö som stöds av deras egna företagsdata, vilket minskar utvecklingsflaskhalsar och möjliggör användningsfall som försäljningsanalys, processautomation och intern kunskapssökning.

Google Workspace fungerar i sig som en samarbetsplattform som förstärks av Gemini, med AI invävd i appar som Gmail, Docs och Meet. Istället för att byta till ett separat AI-verktyg kan användare använda Gemini i sina dagliga produktivitetsappar för att utarbeta innehåll, sammanfatta information eller generera idéer i sitt sammanhang.

I vissa inställningar kan du till och med chatta med Gemini direkt över dina företagsdata som lagras i Google Workspace, Microsoft 365 och andra anslutna system. Det förvandlar Gemini till ett företagskunskapslager som kan svara på frågor baserat på e-postmeddelanden, dokument och filer, med förbehåll för de behörigheter och säkerhetsinställningar som konfigurerats av IT-avdelningen.

Gemini API: ryggraden i utvecklarverktygslådan

Under de användarvänliga Gemini-apparna finns Gemini API, som erbjuder samma kärnmodeller för utvecklare att bädda in i sina egna applikationer. Det är i detta API som multimodalitet, funktionsanrop och anpassade arbetsflöden möts för seriös automatisering, särskilt med Google Workspace och Apps Script.

Gemini-modeller är Googles kraftfullaste AI-system, och API:et erbjuder olika modellvarianter – som textfokuserade och visionsorienterade versioner – var och en med specifika funktioner och begränsningar. Du kan utforska dem visuellt i Google AI Studio, ett värdbaserat gränssnitt för att testa prompter, justera modellinställningar och till och med finjustera anpassade modeller utan att skriva kod.

För att börja använda API:et begär du en API-nyckel via Google AI Studio eller en annan konsol som stöds och testar den sedan med ett enkelt REST-anrop. Du kan till exempel exportera din nyckel till en miljövariabel som GOOGLE_API_KEY och anropa slutpunkten som listar tillgängliga modeller, och ta emot JSON som models/gemini-1.0-pro om allt är korrekt konfigurerat.

Därifrån handlar det om att generera innehåll genom att POSTA en JSON-nyttolast till lämplig slutpunkt, till exempel metoden generateContent för en vald modell. En minimal begäran inkluderar ett innehållsfält med textdelar, medan valfria generationConfig och safetySettings låter dig styra parametrar som temperatur och säkerhetsfilter.

Anropa Gemini API från Apps Script

Ett av de kraftfullaste mönstren i Gemini-verktygslådan är att kombinera API:et med Google Apps Script för att automatisera arbetsflöden i Workspace. Den här metoden låter dig orkestrera Gemini tillsammans med tjänster som Drive, Kalender, Gmail, Kalkylark och Presentationer utan att bygga en fullständig backend.

Standardinstallationen börjar med ett Apps Script-projekt (till exempel skapat via script.new) där du lagrar din Gemini API-nyckel som en skriptegenskap. I kod hämtar du det värdet och konstruerar en slutpunkts-URL för en specifik modell, ofta gemini-1.0-pro-latest:generateContent , med din API-nyckel skickad som en frågeparameter.

En hjälpfunktion som callGemini(prompt, temperature) bygger vanligtvis en JSON-nyttolast, skickar den via UrlFetchApp.fetch och analyserar svaret för att extrahera den genererade texten. Denna omslutning förenklar upprepad användning av API:et från olika verktyg i ditt skript.

Testning är enkelt: du kan skapa en testGemini() -funktion som definierar en prompt, anropar din hjälpare och loggar både in- och utdata till exekveringsloggarna. När det fungerar vet du att din Apps Script-miljö och Gemini API-nyckel är korrekt kopplade för mer avancerade scenarier.

Använda Gemini Vision-slutpunkten för bilder

Gemini-verktygslådan går bortom text tack vare multimodalt stöd, särskilt möjligheten att bearbeta bilder via en visionsaktiverad slutpunkt. I Apps Script är detta vanligtvis en separat slutpunkt som gemini-1.0-pro-vision-latest:generateContent , återigen parametriserad av din API-nyckel.

En typisk hjälpfunktion som callGeminiProVision(prompt, image, temperature) konverterar en bildblob till base64, bäddar in den som inlineData med lämplig MIME-typ och skickar den tillsammans med en textuell prompt. Modellen returnerar sedan text som återspeglar dess förståelse av både bilden och prompten.

För att verifiera inställningarna kan du skriva en liten testGeminiVision() som laddar ner en exempelbild från en offentlig URL, skickar den till din hjälpare och loggar ett roligt faktum eller en analys som producerats av Gemini Vision. Den här typen av test visar att multimodal inmatning fungerar korrekt i din miljö.

När visionsflödet är stabilt kan du återanvända det i automatiseringar på högre nivå, som att analysera diagram från Google Sheets eller bilder lagrade i Drive. Det är där multimodalitet börjar kännas som en verkligt användbar del av verktygslådan snarare än ett demotrick.

Funktionsanrop: ge Gemini tillgång till verktyg

En annan viktig del av Gemini-verktygslådan är funktionsanrop, vilket låter modellen bestämma när den ska anropa dina egna verktyg eller API:er. Istället för att bara generera text kan Gemini returnera strukturerade functionCall- objekt som beskriver vilken funktion som ska användas och med vilka argument.

I Apps Script kan du konfigurera en hjälpare som callGeminiWithTools(prompt, tools, temperature) som skickar en verktygsspecifikation tillsammans med användarprompten. Denna specifikation följer ett FunctionDeclaration- schema, där du beskriver funktionens namn, syfte och JSON-parametrar.

När Gemini bestämmer sig för att ett verktyg ska användas, inkluderar dess svar ett funktionsanropsobjekt som du kan analysera i ditt skript och dirigera till den faktiska implementeringen. Du kan till exempel definiera ett stubverktyg med namnet "datetime" som returnerar aktuellt datum och tid, och titta på hur Gemini begär den funktionen för att lösa frågor relaterade till kalenderberäkningar.

Funktionsanrop är särskilt kraftfulla eftersom de kan fungera över flera vändningar, inte bara enskilda förfrågningar. Det innebär att du kan designa mer komplexa, konversationsbaserade agenter som bestämmer när verktyg ska anropas, tolkar resultaten och fortsätter dialogen.

Demointegrationer: Gemini + Google Workspace som en praktisk verktygslåda

När man kombinerar textgenerering, visuell inmatning och funktionsanrop blir Gemini-verktygslådan en praktisk motor för automatisering av arbetsytor. Googles kodlabbmaterial beskriver flera konkreta exempel som illustrerar vad som är möjligt.

På en övergripande nivå skickas inkommande användarfrågor till Gemini med en uppsättning tillgängliga verktyg som representerar olika arbetsflöden: mötesschemaläggning, e-postutkast från diagram och skapande av bildspel. Baserat på frågan väljer Gemini rätt funktion och returnerar ett funktionsanrop med strukturerade argument som tider, filnamn eller ämnen.

I ditt Apps Script tolkar du sedan funktionsanropet inuti en if…else -kedja och anropar lämpligt arbetsflöde – till exempel setupMeeting() , draftEmail() eller createDeck() . Denna kombination av modellresonemang och explicit skriptlogik är det som förvandlar Gemini från ett chattfönster till en verktygslåda för riktigt arbete.

Automatisera möten: sammanfatta Drive-filer till kalenderhändelser

En demo visar hur Gemini kan hjälpa till att skapa ett kalendermöte som automatiskt inkluderar en sammanfattning av en textfil som finns på Google Drive. Användaren kan skriva något i stil med: ”Boka ett möte klockan 10 imorgon med Helen för att diskutera nyheterna i Gemini-blog.txt-filen.”

Bakom kulisserna deklareras ett arbetsyteverktyg med namnet "setupMeeting" i verktygsspecifikationen, med parametrar för tid, mottagare och filnamn. När Gemini tolkar frågan väljer den detta verktyg och returnerar ett funktionsanrop med dessa argument ifyllda.

Motsvarande setupMeeting() -funktion hittar sedan den angivna filen i Drive, läser dess innehåll och skickar den till Gemini via callGemini() med instruktioner för att skapa ett kort JSON-objekt som innehåller en titel och en kort sammanfattning. Svaret kan komma tillbaka insvept i formateringsstaket som du tar bort innan du analyserar som JSON.

Med hjälp av den extraherade titeln och sammanfattningen skapar skriptet en kalenderhändelse med hjälp av CalendarApp , anger beskrivningen till sammanfattningen och bifogar källfilen via den avancerade kalendertjänsten. Resultatet är ett schemalagt möte med inbyggt kontext, allt utlöst av en enda begäran i naturligt språk.

Utforma e-postmeddelanden från Sheets-diagram med Gemini Vision

Ett annat arbetsflöde i Gemini-verktygslådan innebär att analysera ett diagram i Google Sheets och utarbeta ett Gmail-meddelande baserat på det. Tänk dig att du har ett kalkylblad med universitetsutgifter och vill ha ett e-postmeddelande som sammanfattar vad diagrammet visar för en kollega som heter Mary.

Användarfrågan kan säga: ”Utkasta ett e-postmeddelande till Mary med insikter från diagrammet i CollegeExpenses-arket.” Ett verktyg som heter ”draftEmail” är definierat för att acceptera ett sheet_name och en mottagare, och Gemini väljer det verktyget när den ser den här typen av begäran.

Funktionen draftEmail () letar upp det begärda kalkylarket i Drive, öppnar det relevanta arket, hämtar det första diagrammet och sparar det som en fil (till exempel ExpenseChart.png). Den skapar sedan en prompt som instruerar Gemini att endast använda information i diagrammet, undvika historiska jämförelser och hålla meddelandet koncist.

Genom att anropa callGeminiProVision(prompt, expenseChart) skickar skriptet både prompten och diagrambilden till Gemini Vision, som returnerar en skräddarsydd e-postmeddelandetext. Slutligen skapar skriptet ett Gmail-utkast adresserat till mottagarens e-postadress, anger ett ämne som "Utgifter för högskola" och bifogar diagrambilden.

Detta mönster förvandlar effektivt Gemini till en analytiker som kan läsa ett diagram, extrahera den viktigaste nyheten och formulera den på naturligt språk åt dig. Du granskar och justerar fortfarande utkastet, men det mesta av det tunga arbetet görs automatiskt.

Skapa bildspel automatiskt med Gemini och Google Slides

Det tredje stora demo-arbetsflödet i den här verktygslådan bygger automatiskt en grundläggande Google Slides-presentation om ett användarspecificerat ämne. Du kan till exempel fråga: ”Hjälp mig att sätta ihop en presentation om vattenbesparing.”

Ett verktyg som heter ”createDeck” deklareras med en enda parameter, topic, och Gemini instrueras att returnera strukturerad JSON som beskriver en serie bilder. Prompten talar om för Gemini hur många bilder som ska skapas (baserat på en konstant som NUM_SLIDES), begär korta titlar och punktlistor, och frågar explicit efter ett giltigt JSON-objekt så att skriptet kan tolka det säkert.

Efter att ha anropat callGemini() med den prompten tar skriptet bort alla formateringshinder, analyserar JSON-filen och använder sedan SlidesApp för att generera en ny presentation. Den första bilden behandlas som titelsidan, och efterföljande bilder följer en TITLE_AND_BODY-layout där skriptet fyller i titeln och punkttexten.

Inom några sekunder får du en grundläggande sammanställning med strukturerade diskussionspunkter per bild, redo att anpassas visuellt. Även om resultatet avsiktligt är minimalt, visar detta arbetsflöde hur Gemini kan kickstarta innehållsstrukturen så att du kan fokusera på design och nyanser.

Utöka verktygslådan: chatbotar, RAG och flerfunktionsverktyg

Exemplen ovan är bara en utgångspunkt; Gemini-verktygslådans bredare kan utökas i många riktningar när du väl är bekväm med API:et och funktionsanropen. Google föreslår uttryckligen flera olika vägar att utforska.

Ett populärt användningsfall är att bygga chattrobotar för Google Chat med Gemini API. Här gäller samma mönster: du exponerar verktyg, låter Gemini bestämma när de ska anropas och kopplar tillbaka svaren till ett konversationsgränssnitt inuti Chat, allt styrt av Chat API och tillhörande kodlabb.

En annan viktig inriktning är retrieval-augmented generation (RAG) ovanpå privat innehåll i Drive eller Keep. Istället för att sammanfatta en enda textfil kan man kombinera Gemini API med en vektordatabas och, valfritt, ett orkestreringsramverk som LangChain för att hämta relevanta utdrag från PDF-filer, bilder och anteckningar innan man ber Gemini att generera ett svar baserat på dessa dokument.

Flerfunktionsanrop låser också upp mer sofistikerade agenter som iterativt kan bestämma vilka verktyg som ska användas och i vilken sekvens. Istället för ett enda beslut kan en agent anropa en funktion, undersöka resultatet och sedan anropa en annan funktion eller ställa en förtydligande fråga, allt inom en pågående tråd.

Slutligen finns det inget krav på att stanna kvar inom Workspace; när du väl behärskar Gemini API-mönstren kan du koppla modellen till externa API:er över hela webben. Det är så Gemini övergår från en begränsad företagsassistent till en allmänt organiserande organisatör av digitalt arbete.

Tillsammans bildar dessa delar – stabila verktyg, experimentella labb, handledningsfunktioner, företagsagenter och utvecklar-API:et – en verkligt rik Gemini-verktygslåda som kan anpassas till både vanliga elever och avancerade användare. Om du behandlar Gemini mindre som en enda app och mer som en växande uppsättning instrument du kan komponera, kommer du att ha en stark position att dra nytta av vad Google än lägger till härnäst utan att behöva ompröva hela ditt arbetsflöde varje gång.

Vad är språkmodeller?
Relaterad artikel:
Vad är språkmodeller och hur fungerar LLM:er egentligen