TL;DR
Nytt rammeverk: Apples RubiCap bruker rubrikkveiledet forsterkningslæring for å trene kompakte AI-modeller som genererer bildetekster som konkurrerer med systemer som er 10 ganger større. Nøkkelresultat: RubiCap-7B toppet alle testede tilnærminger på CapArena-benchmark, inkludert modeller med opptil 72 milliarder parametere og merknader fra menneskelige eksperter. Praktisk effekt: RubiCap-2B og RubiCap-3B er små nok for distribusjon på enheten, noe som potensielt forbedrer bildesøk og tilgjengelighet på iPhones og iPads.
Apple-forskere har publisert et nytt rammeverk som trener AI-modeller med så få som 3 milliarder parametere til å produsere bildetekster som slår rivaler opp til 10 ganger størrelsen på viktige benchmarks, ifølge en artikkel som ble utgitt denne uken.
RubiCap er et nytt RL-rammeverk fra Apple og University of Wisconsin–Madison. According to the paper, it uses rubric-guided reinforcement learning to train compact vision-language models that generate more accurate, detailed image descriptions than systems with up to 72 billion parameters. Tzu-Heng Huang, Sirajul Salekin, Javier Movellan, Frederic Sala og Manjot Bilkhu forfattet studien, innsendt til arXiv 10. mars.
![]()
Hvordan rubrikkveiledet opplæring fungerer
Tett bildeteksting er sentralt for opplæring av syn-språk og tekst-til-bilde-modeller, i tillegg til å drive funksjoner som bildesøk og tilgjengelighetsverktøy. Som forskerne bemerker, er tett teksting avgjørende for tverrmodal justering i forhåndstrening for synsspråk og generering av tekst-til-bilde. Å produsere merknader av ekspertkvalitet i stor skala er fortsatt uoverkommelig dyrt, bemerket forskerne.
Men forsterkende læring (RL) har vist lovende i oppgaver der svar kan kontrolleres deterministisk, som matematikk og koding. Åpne oppgaver som bildetekst mangler slike klare evalueringskriterier, noe som gjør RL vanskelig å bruke. Frem til nå har RLs suksesser vært konsentrert i verifiserbare domener, en begrensning som har holdt teknikken unna subjektive generasjonsoppgaver som å beskrive hva som vises i et fotografi.
RubiCap adresserer dette gapet med et vel-rammeverk,
prøvespesifikke belønningssignaler fra rubrikker skrevet av store språkmodeller (LLMs). I stedet for å stole på en enkelt kvalitetspoengsum, deler RubiCap opp evaluering i flere strukturerte kriterier, og gir modellen målrettet tilbakemelding på hvor bildetekstene kommer til kort. Ved å automatisere opprettelsen av evalueringsrubrikker, eliminerer rammeverket behovet for menneskelige annotatorer til å definere kvalitetsstandarder for hvert bilde.
Oversikt over RubiCap-rammeverket. En komité av VLM-er produserer først forskjellige kandidattekster og konsoliderer dem til en konsensus. En LLM-rubrikkforfatter diagnostiserer deretter studentens spesifikke mangler og forvandler dem til finkornede, tolkbare evalueringskriterier. En LLM-dommer bruker disse rubrikkene for å vurdere utrulling av bildetekster, og erstatter grove skalære belønninger med strukturerte, flerdimensjonale signaler som lindrer verifiseringsflaskehalsen i RL. (Kilde: Apple)
RubiCaps pipeline bygger på dette designet i tre trinn. Først setter den sammen en mangfoldig komité av kandidattekster for hvert bilde, hentet fra fem eksisterende visjonsspråklige modeller, inkludert Gemini 2.5 Pro, GPT-5, Alibabas Qwen2.5-VL-72B-Instruct, Gemma-3-27B-IT og Qwen3-VL-30B-A3B-instruksjoner med forskjellige modeller fra pooly
. arkitekturer og treningsdata, fanger komiteen opp en rekke beskrivende strategier og ordforrådsvalg, og gir rikere input for trinnet for generering av rubrikk.
I det andre trinnet analyserer en LLM-rubrikkforfatter drevet av Gemini 2.5 Pro hvert bilde sammen med kandidattekster for å trekke ut konsensusstyrker og diagnostisere svakheter i modellens produksjon. Den konverterer denne innsikten til eksplisitte evalueringskriterier, og erstatter grove skalære belønninger med strukturerte, mangefasetterte rubrikker som dekker nøyaktighet, detaljnivå, hallusinasjonsrisiko og sammenheng.
Som et resultat er hver rubrikk skreddersydd til det spesifikke bildet, noe som betyr at et bilde av et overfylt medisinsk gatemarked mottar et annet satellittbilde eller et satellittbilde.
En egen LLM-dommer, Qwen2.5-7B-Instruct, bruker deretter rubrikkene til å dekomponere kvalitetsvurdering til granulære evalueringer. I stedet for å produsere en enkelt poengsum, vurderer dommeren hvert kriterium uavhengig, og gir treningsmodellen handlingsdyktig tilbakemelding. Spesielt er dommeren en relativt liten modell med 7 milliarder parametere, som holder beregningskostnadene for belønningsrørledningen håndterbare selv i stor skala.
Fordi rubrikken gjør det tunge arbeidet med å definere hva som utgjør en god bildetekst, kan dommeren fokusere utelukkende på å skåre mot disse kriteriene. Å separere generering av rubrikk fra scoring gjør at pipelinen kan bruke en kraftig modell (Gemini 2.5 Pro) for den kreative oppgaven med å skrive evalueringskriterier, samtidig som det gjentatte poengarbeidet delegeres til en mindre, billigere modell.
For team som bygger bildetekstsystemer i stor skala, kan denne arbeidsdelingen redusere kostnadene ved RL-basert opplæring og samtidig bevare kvaliteten på signalene.
50 000 tilfeldig utvalgte bilder fra PixMoCap og DenseFusion-4V-100K datasett, trente forskerne tre modellstørrelser: RubiCap-2B (2 milliarder parametere), RubiCap-3B (3 milliarder parametere) og RubiCap-7B (7 milliarder parametere). Hver variant bygger på eksisterende åpen kildekode visjonsspråkarkitekturer, med RL-treningsfasen lagt på toppen av standard overvåket finjustering.
Referanseresultater
På CapArena, studiens primære benchmark, oppnår RubiCap-7B den høyeste CapArena vinnerrater blant alle testede tilnærminger, bedre enn overvåket destillasjon, tidligere RL-metoder, merknader fra menneskelige eksperter og GPT-4V-forsterkede utganger. I en blind rangeringsevaluering oppnådde RubiCap-7B den”høyeste andelen av rang-1-tildelinger”blant alle modeller, inkludert 72B-og 32B-grensesystemer, samtidig som den registrerte den laveste hallusinasjonsstraffen og de sterkeste nøyaktighetsskårene.
På CaptionQA, en benchmark-måling av ord-7, nøyaktighet og fakta-B. Qwen2.5-VL-32B-Instruer i ordeffektivitet, en modell mer enn fire ganger størrelsen. RubiCap-3B overgikk den større Qwen2.5-VL-7B-Instruct-modellen på samme benchmark, og demonstrerte at den rubrikkveiledede treningsmetoden skalerer ned effektivt.
Selv ved 3 milliarder parametere oppnådde RubiCap det forskerne beskrev som «overlegen ordeffektivitet», og genererte mer informative modelleringstekster over flere ganger per ord,
nedstrøms. viste seg like bemerkelsesverdig. Å bruke den kompakte RubiCap-3B som bildetekst gir sterkere forhåndstrente synsspråkmodeller enn de som er trent på bildetekster fra proprietære systemer, rapporterte teamet. I praksis kan en åpen modell med 3 milliarder parametere erstatte dyre proprietære tekstingsrørledninger uten å ofre, og i noen tilfeller forbedre, kvaliteten på modellene som er trent på produksjonen.
På tvers av begge benchmarks utfordrer resultatene en vanlig antakelse innen synspråkforskning: at skalaen bestemmer bildetekstkvaliteten. Merknader fra menneskelige eksperter, ofte ansett som gullstandarden for bildetekstkvalitet, falt også under RubiCap-7Bs poengsum på CapArena, noe som tyder på at automatisert rubrikkbasert evaluering kan synliggjøre kvalitetsdimensjoner som til og med trente kommentatorer går glipp av.
Praktiske applikasjoner og bransjetrend
Ai breder seg på tvers av bransjen tidlig. 2026, hvor mindre, effektivt trente modeller matcher eller overgår ytelsen til mye større systemer. Alibabas Qwen3.5-9B, for eksempel, nylig slo OpenAIs gpt-bmarks-1 på 0-benchmarks-1 ganger på 1 ganger 1. mindre.
Der i motsetning til, hvor disse gevinstene først og fremst kom fra arkitektur-og dataforbedringer, demonstrerer RubiCap at treningsmetodikk i seg selv, spesifikt utformingen av belønningssignaler, kan bygge bro mellom kompakte modeller og modeller i grenseskala.
RubiCaps tilnærming skiller seg fra tidligere eksempler ved at den bruker en åpen forsterkende læringsoppgave i stedet for en verifisert læringsdominasjon. Ved å generere strukturerte evalueringskriterier gjennom LLM-skrevne rubrikker, skaper rammeverket et belønningssignal der ingen tidligere har eksistert, noe som potensielt åpner døren for at RL kan brukes på andre subjektive generasjonsoppgaver som oppsummering, kreativ skriving eller lydbeskrivelse.
For Apple spesifikt, kompakte modeller som er i stand til å produsere høykvalitets batteribildeutplassering på, hvor implikasjoner og implikasjoner av minnelevetid har tydelige bildetekster. gjør det upraktisk å kjøre modeller med 72 milliarder parametere. RubiCap-2B og RubiCap-3B er små nok til å kjøre på mobil maskinvare, noe som potensielt forbedrer bildesøk og tilgjengelighetsfunksjoner uten å kreve skyslutning. Apple har tidligere avduket kompakte visuelle AI-modeller som STARFlow-V, som signaliserer en bredere forpliktelse til visuell AI på enheten.
I mellomtiden tilbyr RubiCaps effektivitetsgevinster en vei til visuell forståelse av høyere kvalitet på iPhones og iPads uten ventetiden og kostnadene ved skybasert prosessering. Utover forbrukerapplikasjoner, antyder RubiCap-3Bs evne til å utkonkurrere proprietære bildetekster i nedstrøms VLM-opplæring at kvalitetsgevinster fra rubrikkveiledet RL kan øke på tvers av Apples visjonsspråk-pipeline, og redusere avhengigheten av dyre grensemodeller for generering av opplæringsdata.
Apple har også gitt ut en investering i åpent AI-datasett for visuelle bilder i stor skala. infrastruktur. Tett bildeteksting føres direkte inn i tverrmodal justering, prosessen med å lære AI-systemer å koble sammen visuell og tekstlig informasjon. Teksting av høyere kvalitet under foropplæring kan forbedre ytelsen på tvers av et bredt spekter av nedstrømsoppgaver, fra visuelle spørsmålssvar til bildegenerering.
Hvis rubrikkbaserte belønninger generaliserer til andre subjektive oppgaver, kan rammeverket omforme hvordan kompakte modeller trenes på tvers av bransjen.