Wat is AI-modeldistillatie en hoe leren kleine modellen van grote modellen?

Door 쉬었음.com

AI-modeldistillatie is een trainingstechniek waarbij een kleiner, lichter studentmodel een deel van het voorspellende gedrag leert van een groter, competenter maar zwaarder en duurder teachermodel. De formele naam is doorgaans knowledge distillation (KD). Het centrale idee is niet simpelweg om de parameters van het grote model te verkleinen of te kopiëren. In plaats daarvan wordt de student opnieuw getraind om voor dezelfde invoer te lijken op de antwoordverdeling van de teacher en, in sommige gevallen, ook op diens interne representaties.arxiv.org

De reden voor deze techniek is betrekkelijk duidelijk. Grote modellen kunnen goed presteren op complexe problemen, maar in productie krijgen ze te maken met beperkingen zoals responslatentie, geheugen, energieverbruik, serverkosten en apparaatcapaciteit. Distillatie is de keuze om de rekenkracht van de grote teacher tijdens de training te gebruiken en tijdens de operatie een kleinere student in te zetten. De beste manier om distillatie te begrijpen is daarom niet als magie die intelligentie in een kleinere vorm vouwt, maar als een strategie om trainingskosten en operationele kosten over verschillende modellen te verdelen.arxiv.org

Waarom een studentmodel maken in plaats van het grote model rechtstreeks te gebruiken?

De vereisten voor modelontwikkeling en modelgebruik verschillen. Tijdens de training kan het mogelijk zijn om lange perioden en aanzienlijke rekenmiddelen te investeren, terwijl productiediensten vaak korte responstijden en voorspelbare kosten vereisen. In omgevingen zoals mobiele apparaten, embedded apparatuur, API's met grote aantallen verzoeken of implementaties die inferentie op het apparaat moeten uitvoeren vanwege privacyredenen, worden modelgrootte en latentie productvereisten.arxiv.orgarxiv.org

Neem een documentclassificatiedienst. Voor een interne beoordelingsopdracht waarbij het aanvaardbaar is om één document enkele seconden te analyseren, kan er ruimte zijn om een groot model te gebruiken. Maar als gebruikers onmiddellijk een classificatieresultaat moeten zien wanneer zij op een knop drukken, of als miljoenen documenten continu moeten worden verwerkt, lopen het geheugen en de tijd die elke inferentie vereist op. Als een studentmodel taakprestaties behoudt die dicht bij die van de teacher liggen, kan het een optie zijn die aan operationele vereisten voldoet, zelfs als enige kwaliteit wordt opgeofferd.

Toch is het niet veilig om te concluderen dat een kleiner model altijd goedkoper is. Het aantal parameters is een belangrijke indicator voor opslag- en geheugengebruik, maar de feitelijke snelheid hangt ook af van invoerlengte, batchgrootte, rekenbibliotheken, hardware en kosten voor geheugenoverdracht. Daarom mogen versnellingscijfers uit een paper niet ongewijzigd op andere hardware en workloads worden toegepast.arxiv.orgarxiv.org

Wat wisselen teacher- en studentmodellen uit bij knowledge distillation?

Bij gewoon supervised learning wordt het juiste antwoord gegeven als één label, zoals ‘deze afbeelding is een kat’ of ‘deze zin is positief’. Dit kan een hard target worden genoemd. Een teachermodel produceert echter niet slechts één antwoord; het berekent verschillende scores of waarschijnlijkheden voor elk mogelijk antwoord. Voor een afbeelding kan het bijvoorbeeld kat 0,70, vos 0,20 en hond 0,08 voorspellen.

Distillatie gebruikt deze verdeling als aanvullend trainingsmateriaal voor de student. Naast het feit dat kat het juiste antwoord is, geeft zij het signaal dat de teacher de invoer enigszins vergelijkbaar met een vos en minder vergelijkbaar met een hond achtte. Hinton en coauteurs legden uit dat zulke soft targets nuttige informatie kunnen overbrengen die niet in één hard label kan zitten.arxiv.org

Hier betekent ‘kennis’ niet een lijst van regels die in menselijke taal is geschreven. Nauwkeuriger gezegd betekent het de geleerde functie en gedragspatronen van de teacher die specifieke invoer aan uitvoer koppelen. De student hoeft de parameters van de teacher niet rechtstreeks te behouden en kan een ander aantal lagen of een andere architectuur hebben. Wat telt, is dat de uitvoer of representatie van de student voor een gegeven invoer volgens de gekozen doelstelling dichter bij die van de teacher komt.arxiv.orgarxiv.org

Hoe werken soft targets en temperatuur?

De laatste laag van een classificatiemodel produceert gewoonlijk scores die logits worden genoemd en zet die vervolgens via de softmaxfunctie om in een kansverdeling. Bij distillatie kan een softmax worden gebruikt die de logits van teacher en student door een temperatuur (T) deelt, om de verdeling gelijkmatiger te maken.

[ p_i^{(T)}=\frac{\exp(z_i/T)}{\sum_j\exp(z_j/T)} ]

Hier is (z_i) de logit voor klasse (i). Wanneer (T=1), is dit de gewone softmax. Het verhogen van de temperatuur vlakt een verdeling af die uitsluitend op de klasse met de hoogste waarschijnlijkheid is geconcentreerd. Daardoor kunnen relatieve verschillen tussen lager gerangschikte klassen beschikbaar worden als leersignalen. Daarom is het onvolledig om temperatuur slechts te omschrijven als het ‘vervagen van het antwoord van de teacher’. Temperatuur is geen schakelaar die automatisch de hoeveelheid informatie vergroot; het is een regelaar die de vorm verandert van de verdeling waaruit de student leert.arxiv.orgproceedings.mlr.press

In de praktijk combineert training doorgaans twee doelstellingen. Eén loss stimuleert de student om de ware labels te voorspellen, en de andere, de distillatieloss, stimuleert hem om de zachte uitvoer van de teacher te benaderen. Dit kan eenvoudig als volgt worden geschreven.

[ L=\alpha L_{\text{ground truth}}+(1-\alpha)L_{\text{distillation}} ]

(\alpha), de temperatuur (T) en het type distillatieloss zijn allemaal waarden die moeten worden afgestemd. Een hogere temperatuur of een groter gewicht voor het teachersignaal is niet altijd beter. Onderzoek suggereert ook dat het effect van de temperatuurkeuze kan verschillen afhankelijk van kenmerken van de verdeling van de teacher, bijvoorbeeld wanneer de teacher met label smoothing is getraind.proceedings.mlr.pressproceedings.mlr.press

Is alleen de uitvoer matchen voldoende?

De meest basale vorm van distillatie matcht alleen de uiteindelijke uitvoer. Dit kan response-based distillation worden genoemd. In classificatiemodellen zijn waarschijnlijkheden of logits de voornaamste doelen; in taalmodellen is de verdeling over het volgende token het voornaamste doel. Het is relatief eenvoudig te implementeren en kan worden overwogen wanneer de interne architectuur van de teacher onbekend is, zolang de uitvoer toegankelijk is.arxiv.orgproceedings.mlr.press

Sommige benaderingen stellen echter dat eindantwoorden alleen het rekenproces van de teacher niet afdoende kunnen overbrengen. In architecturen waarin meerlaagse representaties en aandacht van belang zijn, zoals Transformers, kan de student worden getraind om tussenliggende signalen te imiteren, waaronder de embeddings, hidden states en aandachtsmatrices van de teacher. Dit wordt feature-based distillation of distillatie van tussenlagen genoemd.arxiv.org

TinyBERT stelde voor om signalen van de embeddinglaag, Transformerlagen en voorspellingslaag te gebruiken, en distillatie toe te passen tijdens zowel algemene pretraining als taakspecifieke fine-tuning. In de ablatie-experimenten in die paper leidde het verwijderen van distillatie van Transformerlagen tot een aanzienlijke prestatiedaling. Dit is geen algemene regel dat distillatie van tussenlagen altijd essentieel is; het is eerder een voorbeeld dat laat zien dat signalen naast de uiteindelijke uitvoer nuttig kunnen zijn, afhankelijk van architectuur en taak.arxiv.org

Een ander onderscheid is dat tussen offline distillation en online distillation. Offline distillatie zet een al getrainde teacher vast en traint een student. Online distillatie gebruikt meerdere modellen die elkaar tijdens de training onderwijzen, of teachersignalen die gelijktijdig ontstaan. Of een afzonderlijke teacher kan worden onderhouden, hoeveel trainingskosten betaalbaar zijn en of modellen samen moeten worden getraind, zijn criteria om daartussen te kiezen.arxiv.org

Waarin verschilt distillatie van pruning en kwantisatie?

Hoewel alle drie worden besproken onder het gezamenlijke doel van modelcompressie, verkleinen ze verschillende zaken. Distillatie gaat over leersignalen en het gedrag van het studentmodel. Pruning vermindert daarentegen de structuur door verbindingen, kanalen, heads of lagen met een lage relevantie te verwijderen. Kwantisatie verlaagt opslag- en rekenkosten door de bitbreedte te verlagen of de numerieke notatie te veranderen waarmee gewichten en activaties worden weergegeven.arxiv.orgarxiv.orgarxiv.org

MethodeWat het primair verandertTypische krachtTe verifiëren voorwaarde
Knowledge distillationLeerdoelstellingen en architectuur van de studentEen klein model leert het gedrag van de teacherKwaliteit van de teacher, data, capaciteitskloof
PruningVerbindingen, kanalen, heads, lagenVerwijdert redundantie uit een bestaande structuurOf de doelhardware sparse structuren daadwerkelijk sneller verwerkt
KwantisatieNumerieke precisieVermindert geheugengebruik en kosten van integerbewerkingenNauwkeurigheidsverlies, hardware- en runtimeondersteuning
Gecombineerd gebruikZowel training als representatiePotentieel voor sterkere compressieKwaliteitsverlies in elke fase en operationele complexiteit

Het omzetten van 32-bits floating-pointgewichten naar 8-bits gehele getallen is bijvoorbeeld kwantisatie. Het trainen van een student-Transformer met zes lagen, waarbij de uitvoerverdeling van een grote teacher het doel is, is distillatie. Ze kunnen ook na elkaar worden toegepast. Dat een paper een hoge compressieverhouding behaalde, betekent echter niet dat de latentie van een echte dienst met dezelfde verhouding zal afnemen. Vooral bij kwantisatie hangt het effect af van hoe goed de doel-CPU, -GPU of -NPU de relevante integerbewerkingen ondersteunt.arxiv.orgarxiv.org

Wat laten voorbeelden uit de BERT-familie zien?

Distillatie van taalmodellen is een nuttig voorbeeld om het concept te begrijpen. BERT-base is een vooraf getrainde Transformer die veel wordt gebruikt voor taalbegripstaken, maar de implementatie ervan kan belastend zijn in omgevingen met beperkte middelen. De DistilBERT-studie presenteerde een pretraining-distillatiemethode die een kleiner model initialiseert vanuit enkele BERT-lagen en loss voor taalmodellering, distillatieloss en cosine-distance loss combineert.arxiv.org

De studie rapporteerde dat ongeveer 97% van de BERT-prestaties op de GLUE-ontwikkelset behouden bleef, terwijl het aantal parameters met ongeveer 40% werd verminderd. Ook toonde zij een kortere inferentietijd onder de CPU-meetomstandigheden die in de paper waren gedefinieerd. Deze cijfers werden echter verkregen met Engelse benchmarks, een specifieke BERT-configuratie, bepaalde hardware en gespecificeerde invoercondities. Ze mogen niet worden aangehaald als universele cijfers die dezelfde resultaten garanderen voor Koreaans, lange documenten, retrieval-augmented systemen, generatieve gesprekken of andere accelerators.arxiv.org

TinyBERT rapporteerde dat een kleiner model met vier lagen sterke prestaties behield ten opzichte van BERT-base, terwijl de omvang en inferentietijd onder de omstandigheden van de paper aanzienlijk werden gereduceerd. Ook presenteerde het ablatie-experimenten waaruit bleek dat algemene distillatie, taakspecifieke distillatie, data-augmentatie en signalen uit tussenlagen allemaal het resultaat beïnvloedden. De praktische les uit dit voorbeeld is eenvoudig: het is niet genoeg om één teacher en één student te verbinden; het moment van distillatie, de data, de studentarchitectuur en het loss-ontwerp bepalen gezamenlijk het resultaat.arxiv.org

Wanneer is distillatie bijzonder effectief?

Distillatie is vooral het overwegen waard wanneer niet de kwaliteit van het grote model perfect behouden moet blijven, maar er tegelijk een duidelijke ondergrens voor prestaties en strikte operationele beperkingen bestaan. Voorbeelden zijn:

  • Inferentie op het apparaat: Omgevingen waarin de netwerkverbinding onbetrouwbaar is of invoer vanwege privacyvereisten moeilijk naar externe servers kan worden verzonden.
  • Herhaalde inferentie met hoog volume: Classificatie-, ranking- en detectietaken die zeer veel korte invoer verwerken, waardoor cumulatieve kosten en latentie belangrijk worden.
  • Domeinspecifieke taken: Gevallen waarin prestaties op een gedefinieerd documenttype of labelsysteem belangrijker zijn dan alle brede mogelijkheden van een algemeen model.
  • Vervanging van een modelensemble: Gevallen waarin het middelen van voorspellingen van verschillende modellen de kwaliteit ten goede komt maar te zwaar is om te gebruiken, zodat één student wordt ingezet om hun gedrag te benaderen.arxiv.org

Omgekeerd moeten de evaluatiecriteria breder zijn wanneer de student zeldzame gevallen nooit mag missen, of wanneer hij het lange redeneerproces, toolgebruik of complexe veiligheidsbeleid van een teacher getrouw moet reproduceren. Zelfs als de gemiddelde nauwkeurigheid hoog is, kunnen de prestaties voor specifieke groepen, zeldzame klassen of risicovolle invoer verslechteren. Onderzoek heeft vastgesteld dat de relatie tussen prestaties voor de slechtst presterende klasse en gemiddelde nauwkeurigheid kan variëren met het ontwerp van de distillatiedoelstelling.proceedings.mlr.press

Wat zijn de beperkingen van distillatie?

Ten eerste leert de student niet de teacher zelf, maar diens waarneembare gedrag. Als de teacher onjuiste voorspellingen doet of databias weerspiegelt, kan de student die signalen ook leren. Hard-label loss naast distillatie gebruiken lost problemen met bias, feitelijke juistheid, beveiliging of veiligheid niet automatisch op. De kwaliteit moet na distillatie nog steeds worden gecontroleerd met een evaluatieset die onafhankelijk is van de oorspronkelijke teacher.arxiv.orgproceedings.mlr.press

Ten tweede kan de student de teacher onvoldoende imiteren als hij te klein is. Dit wordt de teacher-student-capaciteitskloof genoemd. Gerelateerd onderzoek meldt dat prestaties kunnen verslechteren wanneer een kleine student signalen van een buitensporig grote teacher probeert te volgen, en dat een nauwkeuriger teacher niet altijd een betere distillatietheacher is. De keuze van een teacher is niet slechts een rangschikkingswedstrijd; het is ook een kwestie van compatibiliteit met de studentarchitectuur.arxiv.orgarxiv.org

Ten derde kan distillatie operationele kosten verschuiven naar initiële trainingskosten. De teacher moet eerst worden getraind of verkregen, de uitvoer van de teacher voor distillatiedata moet worden berekend en opgeslagen, en temperatuur, lossgewichten en laagkoppelingen moeten mogelijk worden onderzocht. Voor een analyse die maar één keer wordt uitgevoerd kan de teacher daarom rechtstreeks gebruiken eenvoudiger zijn; bij een langdurige, herhaalde dienst is er meer gelegenheid om de ontwikkelkosten van een student terug te verdienen.arxiv.orgarxiv.org

Ten vierde garandeert distillatie geen ‘verklaarbare compressie’. Zelfs als een student voorspellingen produceert die vergelijkbaar zijn met die van de teacher, zijn de vragen of hij beslissingen via dezelfde interne mechanismen neemt en of hij alle informatie van de teacher behoudt, afzonderlijke vragen. Recent onderzoek wijst er ook op dat nog steeds onduidelijk is of een kleine student via distillatie alle informatie van een teacher ontvangt.proceedings.mlr.pressproceedings.mlr.press

Wat zijn veelvoorkomende misvattingen?

De misvatting dat ‘distillatie geen prestatieverlies veroorzaakt’

Distillatieonderzoek laat zien dat kleine modellen hoge prestaties kunnen behouden, maar dit is een observatie onder gespecificeerde evaluatieomstandigheden. Als de invoerverdeling verandert, lange invoer vaker voorkomt of zeldzame gevallen belangrijk worden, kan de kloof tussen teacher en student groeien. Vertrouw daarom niet op één cijfer, zoals ‘een percentage van de prestaties van de teacher’, maar evalueer gezamenlijk de nauwkeurigheid, recall, latentie, geheugen- en veiligheidsmetingen die de dienst vereist.arxiv.orgarxiv.org

De misvatting dat ‘het alle kennis van het teachermodel kopieert’

Binnen beperkte parameters en architectuur benadert de student de uitvoer of sommige representaties van de teacher. Het is moeilijk om te stellen dat alle interne informatie van de teacher ongewijzigd wordt overgedragen. Distillatieresultaten hangen af van de data, doelfunctie, studentcapaciteit en optimalisatiemethode.proceedings.mlr.pressproceedings.mlr.press

De misvatting dat ‘minder parameters noodzakelijkerwijs snellere inferentie betekenen’

Minder parameters helpen over het algemeen om de geheugenvereisten te verlagen, maar de feitelijke latentie hangt af van de rekengrafiek, sequentielengte, batchgrootte en hardwareknelpunten. Vooral de belasting van aandachtsberekeningen in Transformers kan sterk variëren met de invoerlengte; daarom is end-to-endmeting op het doelapparaat nodig.arxiv.orgarxiv.org

De misvatting dat ‘uitvoer van de teacher betekent dat de oorspronkelijke data niet nodig zijn’

Er is onderzoek naar data-free of zero-shot distillatie dat probeert te distilleren met een teacher zonder de oorspronkelijke trainingsdata. Dit is echter een speciale setting waarvoor afzonderlijke generatie van synthetische data of een methode om de invoerverdeling te benaderen nodig is. Gewone distillatie gebruikt representatieve invoerdata samen met teachersignalen, en benaderingen die ook ware labels gebruiken zijn wijdverbreid.proceedings.mlr.pressproceedings.mlr.press

Wat moet u controleren voordat u distillatie in de praktijk implementeert?

Het is veiliger om vanuit implementatiedoelen terug te werken dan op basis van een modelnaam te beslissen. Kwantificeer eerst niet ‘hoe klein een model moet zijn’, maar ‘aan welke kwaliteits- en operationele vereisten moet worden voldaan’. Hieronder staat een minimale checklist.

  1. Scheid de taakcriteria. Definieer naast gemiddelde nauwkeurigheid ook recall, de kosten van false positives en false negatives, prestaties van de slechtst presterende groep, responstijd en geheugenlimieten.
  2. Valideer de teacher. Controleer niet alleen de benchmarkscores van de teacher, maar ook echte domeindata, fouttypen, bias en veiligheidsvereisten. Een niet-gevalideerde teacher biedt niet gegarandeerd goede leersignalen.
  3. Stel eerst het budget voor de student vast. Definieer duidelijk het aantal parameters, maximaal geheugen, toegestane latentie, invoerlengte en implementatiehardware. Als de student te klein is, kan de capaciteitskloof groeien.arxiv.org
  4. Kies de distillatiedoelstelling. Voor eenvoudige classificatie kan outputdistillatie een startpunt zijn; wanneer de kwaliteit van representaties belangrijk is, zoals bij Transformercompressie, kunnen distillatie van tussenlagen en aandachtsdistillatie worden getest.arxiv.org
  5. Vergelijk teacher en student met dezelfde tests. Neem niet alleen algemene nauwkeurigheid mee, maar ook invoerlengtes die lijken op werkelijk verkeer, zeldzame gevallen en groepen met hoge foutpercentages.
  6. Meet op de doelhardware. Maak onderscheid tussen modelbestandsgrootte, geheugen, initiële laadtijd, latentie inclusief tokenisatie en preprocessing, throughput en energieverbruik.arxiv.orgarxiv.org
  7. Valideer vervolgcompressie afzonderlijk. Als na distillatie kwantisatie of pruning wordt toegepast, leg dan na elke fase afzonderlijk de kwaliteitsverslechtering en snelheidswinst vast.

Conclusie: distillatie creëert de juiste operationele balans, niet slechts een ‘klein model’

AI-modeldistillatie draagt voorspellende verdelingen en representaties die door een grote teacher zijn geleerd over op een student, waardoor een model ontstaat dat onder beperkte middelen kan worden gebruikt. De kern is het toevoegen van de soft targets van de teacher aan een student die anders alleen van hard labels leert en, waar nodig, ook signalen uit tussenlagen gebruiken.arxiv.orgarxiv.org

Distillatie is echter geen bestandcompressietechniek die zonder kosten prestaties behoudt. Fouten en bias van de teacher, studentcapaciteit, de representativiteit van de distillatiedata, temperatuur en loss-ontwerp, en de kenmerken van de werkelijke hardware bepalen allemaal het resultaat. De verstandigste volgende stap is daarom niet om een compressieverhouding uit een bepaalde paper na te streven, maar om de minimale kwaliteit en maximale latentie en kosten voor uw eigen taak te definiëren, en daarna de teacher en kandidaat-studenten onder dezelfde omstandigheden te vergelijken.

Veelgestelde vragen

Is AI-modeldistillatie simpelweg het comprimeren van een modelbestand?

Nee. Knowledge distillation is een methode om een kleiner studentmodel vanaf nul te trainen met de uitvoerverdeling of tussenliggende representaties van een groter teachermodel als leersignalen. Het kernmechanisme verschilt van kwantisatie, die de bestandsgrootte verkleint, en pruning, waarbij onnodige verbindingen worden verwijderd.

Levert een groter teachermodel altijd een beter studentmodel op?

Niet noodzakelijk. Als het capaciteitsverschil tussen teacher en student te groot is, kan een capaciteitskloof ertoe leiden dat de student de signalen van de teacher onvoldoende kan leren. Een nauwkeuriger, grotere teacher garandeert geen betere student dan een kleinere teacher.

Garandeert een gedistilleerd model dezelfde nauwkeurigheid als het oorspronkelijke model?

Nee. Studies zoals DistilBERT en TinyBERT laten zien dat kleinere modellen onder specifieke dataset- en hardwareomstandigheden hoge prestaties kunnen behouden, maar de prestatiekloof in de praktijk hangt af van de taak, data, invoerlengte, studentarchitectuur en hyperparameters.

Kunnen knowledge distillation en kwantisatie samen worden gebruikt?

Ja. Distillatie gaat over de manier waarop het studentmodel wordt getraind, terwijl kwantisatie gaat over de numerieke representatie van gewichten en bewerkingen; ze pakken dus verschillende problemen aan. Bij combinatie moeten nauwkeurigheid, latentie en geheugengebruik echter afzonderlijk op de doelhardware worden gevalideerd.

Kan distillatie worden toegepast op generatieve AI?

Het principe kan worden toegepast. Generatieve modellen omvatten echter tokenverdelingen, lange generatieprocessen, veiligheidsregels, toolgebruik en ander gedrag, in plaats van één classificatiekans. Alleen de einduitvoer overeen laten komen, toont niet aan dat de mogelijkheden en het veiligheidsgedrag van het oorspronkelijke model identiek zijn gereproduceerd.