Enhet 7 / 10

Modellnivåer och förmågor: Resonemang, hastighet och val av små/stora modeller

Vinster:

  • Känner igen lätta, balanserade och kraftfulla modellsteg och resonemangsläge
  • Välja lämplig modellnivå baserat på en uppgifts svårighetsgrad
  • Förmåga att medvetet etablera balansen mellan latens, noggrannhet och kostnad

Vi lärde oss att räkna ut priset; Låt oss nu prata om vad vi får för det priset, nämligen modellnivåer och kapacitet. Tre krafter konkurrerar ständigt när man väljer en modell: kvalitet (noggrannhet), hastighet (latens) och kostnad. Att förbättra två av dessa tre innebär ofta att man kompromissar med den tredje. I enheten får du lära dig om lätta, balanserade och kraftfulla nivåer, resonemangsläge och preferens för små/stora modeller; Du kommer medvetet att kunna skapa den rätta balansen efter uppgiftens svårighetsgrad.

Tre nivåer, tre olika jobbkaraktärer

Nästan varje leverantör erbjuder tre nivåer inom samma familj. Låt oss matcha dessa med uppgiftens karaktär:

  • Lätt nivå (liten modell): Mycket snabb, mycket billig, "tillräckligt bra". Idealisk för enkla, repetitiva uppgifter med stora volymer: klassificering, briefing, taggning, datarensning, enkla svarsutkast.
  • Balanserad nivå (medium modell): Bra kvalitet, rimlig hastighet, rimlig kostnad. "Standardvalet" för det mesta dagliga arbetet: innehållsproduktion, mellanlängdsanalys, kundsvar.
  • Kraftfull nivå (stor modell): Högsta kvalitet, långsammast, dyrast. För komplexa resonemang, lång och flerstegsanalys, svår kod, exakt juridisk/ekonomisk utvärdering.
Tips: En bra startregel: Börja med en balanserad nivå. Om kvaliteten är dålig, gå upp till den starka nivån; Om kvaliteten är extremt bra och volymen hög, gå ner till ljusnivån. ”Börja med tillräckligt bra”-metoden, inte ”börja med den starkaste”-metoden, sparar både pengar och tid.

Vad är Reasoning Mode?

Vissa modeller kanske först "tänker" svaret steg för steg snarare än att generera det direkt. Detta kallas resonemangsläge. Modellen delar upp ett problem i delar, bearbetar de mellanliggande stegen inom sig och ger först därefter det slutgiltiga svaret. Detta liknar en elev som löser ett matematiskt problem steg för steg på papper.

När är det värdefullt? I flerstegs, logiska problem: en komplex beräkning, upptäckt av motsägelser, en lång kedja av slutledningar, ett svårt kodfel. I den här typen av arbete ökar resonemang avsevärt noggrannheten.

Vad kostar det? Resonemang ökar kostnaden och latensen eftersom modellen genererar fler "tänketokens". Så det blir både dyrare och långsammare. Ett enkelt "är den här recensionen positiv?" Att resonera i frågan är som att döda en fluga med en hammare; skapar onödiga kostnader och förseningar.

Varning: Lämna inte resonemangsläget öppet för varje uppgift. Det är både snabbare och billigare att hålla stängt för enkla uppgifter. Vissa av de moderna modellerna kommer med ett "adaptivt" tankesätt som själv bestämmer när det behöver tänka; Det är dock din uppgift att hantera det medvetet.

Kvalitet, hastighet, kostnadstriangel

prioritet

Lämplig nivå

resonemang

Lägsta kostnad, hög volym

lätt

Stängt

Balans (de flesta jobb)

balanserad

beroende på situationen

Högsta noggrannhet, kritiskt beslut

stark

öppna

Omedelbart svar, låg latens (chatt)

Lätt/balanserad

Stängt

Komplex analys i flera steg

stark

öppna

När du tittar på den här tabellen, fråga dig själv: "Vad blir kostnaden om jag gör ett misstag i den här uppgiften?" Om priset är högt (fel juridisk bedömning, fel ekonomiskt beslut) är investeringen av stark kaliber och resonemang motiverad. Om priset är lågt (felklassificering av en produktetikett) räcker det med en lätt och snabb modell.

Liten modell eller stor modell?

Tvärtemot vad många tror kräver inte alla jobb en stor modell. Mindre modeller har blivit förvånansvärt kapabla och utför många uppgifter till en tiondel av kostnaden och flera gånger snabbare än den större modellen. Tre frågor till beslut:

  1. Är uppgiften enkel och formulerad? (Klassificering, utdrag, kort sammanfattning) → Liten modell.
  2. Är volymen för hög och hastigheten kritisk? → Liten modell, eftersom stor modell är dyr och långsam.
  3. Kräver uppgiften nyanserade resonemang, utökat sammanhang eller kreativitet? → Stor modell.

Tre realistiska fall

Fall 1 — Den lätta modellen är tillräcklig. Ett e-handelsteam sorterar 40 000 kundkommentarer om dagen i positiva/negativa/neutrala. De provar den med den kraftfulla modellen och jämför den sedan med den lätta modellen: noggrannheten är nästan densamma (96 % mot 94 %), men den lätta modellen är 8 gånger billigare och 3 gånger snabbare. Den lätta modellen är det absolut rätta valet för denna uppgift; Den extra 2% noggrannheten motiverar inte 8x kostnaden.

Fall 2 — Stark modell + resonemang är ett måste. Ett skattekonsultföretag vill beräkna ett komplext skattescenario i flera steg. Lättviktsmodellen gör fel i mellansteg och ger felaktiga resultat. När de använder den kraftfulla modellen med resonemangsläget aktiverat, fortskrider modellen steg för steg och når den korrekta slutsatsen. Här är extra kostnader och förseningar acceptabla eftersom kostnaden för fel är hög; En expert bekräftar dock resultatet.

Fall 3 – Blandad användning. Ett callcenter bearbetar samtalsutskrifter i två steg: först sammanfattar det kortfattat varje samtal med en lättviktsmodell (hög volym, enkelt jobb), sedan ger det bara samtalen markerade som "klagomål" till den kraftfulla modellen och utför en grundorsaksanalys (låg volym, komplext jobb). Så de behandlar huvuddelen av volymen billigt, samtidigt som de reserverar kraften i det starka mönstret för de få samtal som verkligen betyder något.

Svag prompt / Stark prompt

Svag uppmaning:

Lös detta skattescenario. [komplicerat scenario]

Det är oklart hur noggrant modellen kommer att överväga.

Kraftfull uppmaning:

Din roll: senior skattespecialist. Uppgift: Lös följande flerstegsscenario steg för steg. Lista först antagandena, beräkna och visa sedan varje steg för sig och ge slutligen nettoresultatet. Om det finns en punkt som du inte är säker på eller som beror på lagstiftningen, markera den som "expertbekräftelse krävs". Hoppa över mellansteg.[scenario]

Den kraftfulla uppmaningen guidar modellen genom steg-för-steg-tänkande (uppmuntrande resonemang) och gör mellansteg synliga för verifierbarhet.

Kopierbara mallar

Steg 1 diagnos:

Mitt uppdrag: [UPPGIFT]. Volym: [NUMBER/dag]. Felkostnad: [LOW/MEDIUM/HIGH]. Hastighetsprioritet: [LOW/HIGH]. Baserat på denna profil, vilken nivå (lätt/balanserad/stark) och resonemang (öppen/stängd) skulle du rekommendera? Rättfärdiga.

2. Beslut om liten/stor modell:

Jag definierar följande uppgift: [TASK]. Kan detta problem lösas med en liten (lätt) modell, eller krävs en stor modell? Föreslå 3 testfall och en framgångströskel för mig att försöka lösa med den lilla modellen.

3. Lämpligheten av resonemang:

Skulle resonemangsläget (steg-för-steg-tänkande) vara fördelaktigt eller kostsamt i följande uppgift: [UPPGIFT]? Motivera ditt beslut baserat på antalet steg och den logiska komplexiteten i uppgiften.

4. Tvåstegs arbetsflödesdesign:

Designa ett tvåstegsflöde för att minska kostnaderna för följande högvolymuppgift [UPPGIFT]: vilken del ska gå till den lätta modellen, vilken del ska gå till den kraftfulla modellen? Skriv nivån och motiveringen för varje steg.

Vanliga misstag

  • En kraftfull modell för varje jobb: Skapar onödiga kostnader och förseningar genom att använda den mest kraftfulla modellen i enkla och omfattande jobb.
  • Lämna alltid resonemang på: Att behålla tankeläget i enkla uppgifter och slösa bort tid och pengar förgäves.
  • Att fatta beslut utan att mäta kvalitet: Utgå från att "större är bättre" utan att jämföra två nivåer med din egen data.
  • Att glömma behovet av snabbhet: På platser där ett omedelbart svar krävs, som chatt, att välja en långsam och kraftfull modell och låta användaren vänta.
  • Tänker inte alls på tvåstegsflödet: Att inte ha hela volymen byggd av en enda modell och inte spara på den del som kan göras billigt.

Sammanfattningsvis

  • Modellval är en balansgång i triangeln kvalitet, hastighet och kostnad; Att förbättra två kräver ofta att man kompromissar med den tredje.
  • Lätt scen lämpar sig för enkla/bulkiga jobb, stark scen lämpar sig för komplexa/kritiska jobb; Det balanserade stadiet är en bra start för de flesta jobb.
  • Resoneringsläget förbättrar noggrannheten i flerstegsproblem men ökar kostnaden och fördröjningen; Det bör inte lämnas öppet för varje uppgift.
  • "Vad kostar det att misslyckas i det här uppdraget?" Frågan är kompassen för beslutet om nivå och resonemang. Tvåstegsflöden ger stora besparingar i volymjobb.

Applikationsuppgift

Välj en uppgift i ditt jobb och bestäm vilken fas och resonemangsinställning som är lämplig med mall 1 (stadiediagnos). Om uppgiften är hög volym, kom med en design som riktar en del av volymen till den lätta modellen och den kritiska delen till den starka modellen med mall 4 (tvåstegs arbetsflöde). Vi kommer att använda denna design i modellportföljstudien i del 9.

checklista

  • [ ] Jag kan matcha arbetskaraktären av lätta, balanserade och kraftfulla scener.
  • [ ] Jag kan förklara vad resonemangsläge gör och vad det kostar.
  • [ ] Jag kan medvetet fastställa balansen mellan kvalitet, hastighet och kostnad för en uppgift.
  • [ ] Jag kan svara på frågan om liten eller stor modell med tre frågor.
  • [ ] Jag kan designa ett tvåstegsflöde för ett jobb med hög volym.