Sebastien Rousseau

MM1

Pagsulong ng AI sa pamamagitan ng maraming-anyong LLM: kabatiran mula sa MM1

Ang pag-aaral ng Apple sa paunang pagsasanay ng maraming-anyong LLM: ang halo ng datos, ang resolusyon ng larawan, at ang tagakabit ng paningin at wika.

8 min basahin
Banner for: Pagsulong ng AI sa pamamagitan ng maraming-anyong LLM: kabatiran mula sa MM1

Pagsulong ng AI sa pamamagitan ng malalaking modelo ng wikang maraming anyo: kabatiran mula sa MM1 #

Panimula #

Nagbunga ang pagsasanib ng pagproseso ng likas na wika at ng pagkilala ng larawan sa pagbuo ng malalaking modelo ng wikang maraming anyo (MLLMs). At sa papel ng pananaliksik nito, inihaharap ng Apple ang modelong MM1, isang pangkat ng mga modelong AI na maraming anyo na pinagsasama ang biswal at pangwikang pag-unawa. At sinuri ng mga mananaliksik sa pamamagitan ng masusing eksperimento ang mga salik na nag-aambag sa bisa ng mga modelong ito, at tinuklas nila ang iba't ibang pagpipiliang arkitektural at kombinasyon ng datos sa paunang pagsasanay. At naghahandog ang papel ng MM1 ng saligang impormasyon hinggil sa kung paano binubuo at sinasanay ang malalaking modelo ng wikang maraming anyo. Tinatalakay ng artikulong ito ang paraan ng pag-aaral at ang mapagpasya nitong konklusyon, at itinatampok nito ang posibleng epekto ng mga ito sa kinabukasan ng AI.

divider.class="m-10 w-100"

Ang pagsulpot ng AI na maraming anyo #

Nasaksihan ng larangan ng AI ang kapansin-pansing pagsulong sa mga nakaraang taon, lalo na sa larangan ng pagproseso ng likas na wika (NLP) at ng biswal na pagkilala ng kompyuter. At binago ng malalaking modelo ng wika (LLMs) ang paraan ng pag-unawa at paglikha ng mga makina ng wikang pantao, kaya binigyang-kakayahan nila ang mga ito na magsagawa ng masasalimuot na gawain tulad ng pagsasalin ng wika, ng pagbubuod ng teksto, at maging ng malikhaing pagsulat. At sa katulad na paraan, binago ng convolutional neural network (CNNs) ang pagkilala ng larawan, kaya pinahintulutan nila ang mga makina na madama at bigyang-kahulugan ang biswal na datos nang may katumpakang walang katulad.

Kumakatawan ang malalaking modelo ng wikang maraming anyo sa susunod na hangganan sa AI, sapagkat pinagsasama nila ang lakas ng pagproseso ng likas na wika at ng biswal na pagkilala ng kompyuter upang makalikha ng mga modelong kayang magproseso at lumikha ng impormasyon nang maayos sa teksto at sa larawan. At binubuksan ng pagsasanib na ito ng mga anyo ang isang mundo ng posibilidad, mula sa mas kaakit-akit na birtuwal na katulong hanggang sa matatalinong kasangkapan sa paglikha ng nilalaman na kayang lumikha ng nakabibighaning karanasan sa maraming midya.

divider.class="m-10 w-100"

Ang pag-aaral na MM1: isang palatandaan sa pananaliksik ng AI na maraming anyo #

Nakatayo ang pag-aaral na MM1: Methods Analysis & Insights from Multimodal LLM Pre-training ⧉ bilang mahalagang sandali sa ebolusyon ng malalaking modelo ng wikang maraming anyo. At pinamunuan ito ng pangkat ng mga kilalang mananaliksik, at layunin nitong ibunyag ang pangunahing sangkap at ang saligang estratehiya para sa mabisang paunang pagsasanay ng mga modelong ito, na nakatuon sa modelong MM1 bilang sanggunian ng AI na maraming anyo.

Ang pamamaraan at layunin #

Gumamit ang paglalathala ng MM1 ng mahigpit na eksperimental na paraan upang siyasatin ang detalye ng arkitekturang maraming anyo at ng estratehiya sa paunang pagsasanay. At tinuklas ng mga mananaliksik ang iba't ibang bahagi ng modelo, kabilang na ang tagakodigo ng larawan, ang tagakabit ng paningin at wika, at ang pagpili ng iba't ibang hanay ng datos sa paunang pagsasanay. At sa sistematikong pagsusuri ng mga sangkap na ito, hinangad ng pag-aaral na matukoy ang mapagpasyang salik na nag-aambag sa pagpapatibay ng bisa ng malalaking modelo ng wikang maraming anyo.

Isa sa pangunahing layunin ng pananaliksik ang pagtukoy sa pinakamainam na halo ng datos sa paunang pagsasanay upang makamit ang nakahihigit na kakayahan sa pagkatuto mula sa iilang halimbawa (few-shot). At tumutukoy ang pagkatuto mula sa iilang halimbawa sa kakayahan ng modelo na umangkop at matuto mula sa limitadong bilang ng halimbawa, na saligang bahagi sa mga sistemang AI na dapat maging nababaluktot at mabisa sa mga aplikasyon sa tunay na buhay.

divider.class="m-10 w-100"

Ang mga pangunahing resulta at kabatiran #

Nagbunga ang pag-aaral na MM1 ng ilang mapanguna na kabatirang humubog sa ating pag-unawa sa malalaking modelo ng wikang maraming anyo at sa potensiyal ng mga ito. At isa sa pinakamahalagang resulta ang halaga ng maayos na pinagsama-samang halo ng datos sa paunang pagsasanay. Natuklasan ng mga mananaliksik na saligan ang pagsasama ng datos na larawan-kapsiyon, ng datos na larawan-tekstong magkasalit, at ng datos na tekstong lamang upang makamit ang pinakamainam na bisa sa pagkatuto mula sa iilang halimbawa. At itinatampok ng kabatirang ito ang pangangailangan ng sari-sari at masaklaw na hanay ng datos sa paunang pagsasanay na kayang kunin ang detalye ng komunikasyong maraming anyo.

Isa pang namumukod na bahagi ng pag-aaral na MM1 ang pagsasama ng mga modelong siksik na may parametrong umaabot sa 30 bilyon, at ng mga baryanteng mixture-of-experts (MoE), kaya pinatutunayan nito ang kakayahang lumawak at ang kakayahang umangkop ng arkitektura. At ibinunyag ng pag-aaral na ang resolusyon ng larawan ang may pinakamalaking epekto sa bisa ng modelo, higit pa nga sa laki ng modelo, kaya binibigyang-diin nito ang halaga ng mataas ang kalidad na biswal na input sa pagkatutong maraming anyo.

Malaki ang naging epekto ng pagpili ng arkitektura ng tagakodigo ng larawan, tulad ng ResNet o ng ViT, sa kakayahan ng modelo na kumuha ng makabuluhang katangian mula sa biswal na datos at pagsamahin ang mga ito sa impormasyong tekstuwal. At bukod dito, gumanap ng mahalagang papel ang resolusyon ng ipinasok na larawan sa pagtatakda ng kalidad at detalye ng biswal na katangiang nakukuha ng modelo.

Binibigyang-liwanag din ng pag-aaral na MM1 ang halaga ng tagakabit ng paningin at wika sa pagbibigay-kakayahan ng maayos na pakikipag-ugnayan sa pagitan ng biswal at tekstuwal na anyo. At sinubok ng mga mananaliksik ang iba't ibang pamamaraan upang pagsamahin ang impormasyon mula sa tagakodigo ng larawan at mula sa modelong pangwika, kaya natukoy nila ang mekanismo ng cross-attention at ng multi-head attention bilang mabisang estratehiya para sa mayaman at kontekstuwal na angkop na pakikipag-ugnayan.

divider.class="m-10 w-100"

Ang arkitektura ng modelong MM1 at ang proseso ng pagkatutong maraming anyo #

MM1 Model Architecture.class="m-10 w-100"

Ipinapaliwanag ng diyagram ang arkitektura ng modelong MM1 at ang proseso ng pagkatuto nito. Binubuo ang datos sa paunang pagsasanay ng input na larawan at ng input na teksto, kung saan pinoproseso ang input na larawan ng Image Encoder at tuwirang pinapakain naman ang input na teksto sa naunang sinanay na transformer ng malaking modelo ng wika. At kinukuha ng Image Encoder ang biswal na katangian mula sa ipinasok na larawan, na ipinapasa naman sa VL Connector (Vision-Language Connector). At pinagsasama ng VL Connector ang biswal na katangian at ang impormasyong tekstuwal mula sa naunang sinanay na transformer. At binibigyang-kakayahan ng pagsasanib na maraming anyo na ito ang modelo upang makalikha ng output na captioning para sa pagsagot sa biswal na tanong (VQA) sa pamamagitan ng maingat na pag-aayos ayon sa tagubilin.

Binubuo ang kombinasyon ng datos sa paunang pagsasanay ng 45% na datos na magkasalit, ng 45% na kapsiyon, at ng 10% na datos na tekstong lamang, kaya itinatampok nito ang halaga ng sari-saring uri ng datos sa pagsasanay ng modelong MM1.

divider.class="m-10 w-100"

Ang MM1: isang sanggunian para sa AI na maraming anyo #

Nakatayo ang modelong MM1, na binuo sa loob ng pag-aaral, bilang sanggunian para sa AI na maraming anyo, at pinatutunayan nito ang potensiyal ng malalaking modelo ng wikang maraming anyo sa iba't ibang aplikasyon. At sa maingat nitong idinisenyong arkitektura at sa sistema nito ng paunang pagsasanay, nagpapamalas ang MM1 ng pambihirang bisa sa hanay ng gawain, mula sa pagsagot sa biswal na tanong hanggang sa paglalarawan ng larawan.

Nasa kakayahan nitong lumikha ng magkakaugnay at kontekstuwal na angkop na teksto batay sa biswal na input ang isa sa pangunahing lakas ng MM1. Halimbawa, kapag ipinakita ang larawan ng isang abalang lansangan sa lungsod, kayang lumikha ng MM1 ng detalyado at tumpak na paglalarawang kumukuha sa diwa ng tanawin at nagtatampok sa pangunahing elemento nito tulad ng arkitektura, ng mga tao, at ng mga gawain.

Ang kahihinatnan at ang mga direksiyon sa hinaharap #

May malayong-abot na kahihinatnan ang resulta ng pag-aaral na MM1 para sa kinabukasan ng AI at ng pagkatutong maraming anyo. At naghahandog ang kabatirang nakuha mula sa pananaliksik na ito ng matatag na saligan para sa pagbuo ng mas abante at mas may-kakayahang arkitekturang MLLM, kaya inihahanda nito ang daan para sa mga sistemang AI na kayang maglayag nang maayos sa mundong maraming anyo na ating ginagalawan at bigyang-kahulugan ito.

Halina't imbentuhin natin ang bukas sa halip na mag-alala sa nangyari kahapon. — Steve Jobs

Isa sa kapana-panabik na larangan ng pananaliksik sa hinaharap ang pagtuklas sa bagong pamamaraan upang pagsamahin ang biswal at tekstuwal na impormasyon sa loob ng malalaking modelo ng wikang maraming anyo. At itinampok ng pag-aaral na MM1 ang bisa ng mekanismo ng cross-attention at ng multi-head attention, ngunit malawak pa rin ang potensiyal para sa higit pang inobasyon sa larangang ito. At maaaring saliksikin ng mga mananaliksik ang bagong arkitekturang kayang dinamikong umangkop sa nilalaman at balangkas ng ipinasok na datos, kaya pinahihintulutan nito ang mas nababaluktot at mas may-kamalayan-sa-konteksto na pakikipag-ugnayang maraming anyo.

At isa pang maaasahang larangan ang paggamit ng mga modelong ito sa mga senaryo sa tunay na buhay, tulad ng matatalinong birtuwal na katulong, ng kasangkapan sa edukasyon, at ng paglikha ng malikhaing nilalaman. Sapagkat binubuksan ng kakayahan ng mga modelong ito na magproseso at lumikha ng impormasyon sa teksto at sa larawan ang malawak na saklaw ng posibilidad para sa pagpapatibay ng komunikasyon sa pagitan ng tao at makina at para sa paglikha ng mas kaakit-akit at mas nakalulubog na karanasan.

Ang susunod na malaking hakbang sa AI ay magiging mga makinang higit na nauunawaan ang mundo sa paligid nila, sa pamamagitan ng kakayahan nilang unawain at pangatwiranan ang datos na hindi pa nila nakikita noon. — Yann LeCun

divider.class="m-10 w-100"

Pangwakas #

Kumakatawan ang pag-aaral na MM1 sa saligang palatandaan sa ebolusyon ng malalaking modelo ng wikang maraming anyo, sapagkat naghahandog ito ng di-mapapantayang kabatiran hinggil sa arkitektura, sa estratehiya ng paunang pagsasanay, at sa potensiyal ng malalakas na matatalinong sistemang ito. At sa masusing pagsusuri sa saligang sangkap at pamamaraan ng mabisang paunang pagsasanay ng MLLMs, naglatag ang pag-aaral ng saligan ng mga darating na inobasyon sa AI na maraming anyo.

Walang dudang huhubugin ng mga aral na nakuha mula sa pag-aaral na MM1 ang pagbuo ng mas sopistikado at mas may-kakayahang malalaking modelo ng wikang maraming anyo. At taglay ng mga modelong ito ang posibilidad na baguhin ang paraan ng ating pakikipag-ugnayan sa mga makina, sapagkat pinahihintulutan nila ang mas likas, mas madaling maunawaan, at mas may-kamalayan-sa-konteksto na komunikasyon sa pamamagitan ng tekstuwal at biswal na anyo.

At kumakatawan ang mismong modelong MM1 sa patotoo ng napakalaking potensiyal ng mga modelong ito, sapagkat pinatutunayan nito ang pambihirang bisa sa hanay ng gawain at naglalatag ito ng bagong sanggunian para sa AI na maraming anyo. At habang patuloy na nagtatayo ang mga mananaliksik sa ibabaw ng kabatirang nakuha mula sa pag-aaral na ito, maaari nating asahan ang kinabukasang maglalayag at magbibigay-kahulugan nang maayos ang mga sistemang AI sa masalimuot at maraming anyong mundong ating tinitirhan, kaya inilalapit nito tayo sa pananaw ng tunay na matatalinong makina.

Upang matuto pa hinggil sa mapanguna na pag-aaral na MM1 at matuklasan ang kahanga-hangang mundo ng malalaking modelo ng wikang maraming anyo, inaanyayahan ko kayong basahin ang orihinal na papel ng pananaliksik: MM1: Methods Analysis & Insights from Multimodal LLM Pre-training ⧉

Huling sinuri .

I-cross-post ang artikulong ito

Kopyahin ang format para sa Medium

# Pagsulong ng AI sa pamamagitan ng maraming-anyong LLM: kabatiran mula sa MM1 — Sebastien Rousseau

> Originally published at [https://sebastienrousseau.com/fil/2024-03-18-maraming-anyong-llm-kabatiran-mula-sa-mm1/](https://sebastienrousseau.com/fil/2024-03-18-maraming-anyong-llm-kabatiran-mula-sa-mm1/)

Ang pag-aaral na MM1 ng Apple hinggil sa paunang pagsasanay ng malalaking modelo ng wikang maraming anyo: ang halong 45/45/10 ng datos, kung bakit mas mahalaga ang resolusyon ng larawan kaysa sa laki ng modelo, at ang papel ng tagakabit ng paningin at wika.

Read the full article on sebastienrousseau.com: https://sebastienrousseau.com/fil/2024-03-18-maraming-anyong-llm-kabatiran-mula-sa-mm1/

Kopyahin ang format para sa Mastodon

Pagsulong ng AI sa pamamagitan ng maraming-anyong LLM: kabatiran mula sa MM1 — Sebastien Rousseau

Ang pag-aaral na MM1 ng Apple hinggil sa paunang pagsasanay ng malalaking modelo ng wikang maraming anyo: ang halong 45/45/10 ng datos, kung bakit mas mahalaga ang resolusyon ng larawan kaysa sa laki ng modelo, at ang papel ng tagakabit ng paningin at wika.

https://sebastienrousseau.com/fil/2024-03-18-maraming-anyong-llm-kabatiran-mula-sa-mm1/

Kopyahin na naka-format para sa LinkedIn

Pagsulong ng AI sa pamamagitan ng maraming-anyong LLM: kabatiran mula sa MM1 — Sebastien Rousseau

Ang pag-aaral na MM1 ng Apple hinggil sa paunang pagsasanay ng malalaking modelo ng wikang maraming anyo: ang halong 45/45/10 ng datos, kung bakit mas mahalaga ang resolusyon ng larawan kaysa sa laki ng modelo, at ang papel ng tagakabit ng paningin at wika.

Narito ang mga pangunahing estratehikong aral:

- Pagsulong ng AI sa pamamagitan ng malalaking modelo ng wikang maraming anyo: kabatiran mula sa MM1. Nagbunga ang pagsasanib ng pagproseso ng likas na wika at ng pagkilala ng larawan sa pagbuo ng malalaking modelo ng wikang maraming anyo (MLLMs).
- Panimula. Nagbunga ang pagsasanib ng pagproseso ng likas na wika at ng pagkilala ng larawan sa pagbuo ng malalaking modelo ng wikang maraming anyo (MLLMs).
- Ang pagsulpot ng AI na maraming anyo. Nasaksihan ng larangan ng AI ang kapansin-pansing pagsulong sa mga nakaraang taon, lalo na sa larangan ng pagproseso ng likas na wika (NLP) at ng biswal na pagkilala ng kompyuter.
- Ang pag-aaral na MM1: isang palatandaan sa pananaliksik ng AI na maraming anyo. Nakatayo ang pag-aaral na [MM1: Methods Analysis & Insights from Multimodal LLM Pre-training ⧉][00] bilang mahalagang sandali sa ebolusyon ng malalaking modelo ng wikang maraming anyo.

Ano ang diskarte ng inyong organisasyon sa mga hamon na tinukoy sa piraso na ito?

→ https://sebastienrousseau.com/fil/2024-03-18-maraming-anyong-llm-kabatiran-mula-sa-mm1/

#Mm1 #Apple #MaramingAnyo #Mllm #MalakingModeloNgWika

Sebastien Rousseau | CC-BY-4.0
Sipiin ang artikulong ito

Pagsulong ng AI sa pamamagitan ng maraming-anyong LLM: kabatiran mula sa MM1 — Sebastien Rousseau

Ang pag-aaral na MM1 ng Apple hinggil sa paunang pagsasanay ng malalaking modelo ng wikang maraming anyo: ang halong 45/45/10 ng datos, kung bakit mas mahalaga ang resolusyon ng larawan kaysa sa laki ng modelo, at ang papel ng tagakabit ng paningin at wika.

BibTeX

@online{rousseau2024pagsulong,
  author  = {Rousseau, Sebastien},
  title   = {{Pagsulong ng AI sa pamamagitan ng maraming-anyong LLM: kabatiran mula sa MM1 — Sebastien Rousseau}},
  year    = {2024},
  url     = {https://sebastienrousseau.com/fil/2024-03-18-maraming-anyong-llm-kabatiran-mula-sa-mm1/},
  urldate = {2024}
}

RIS

TY  - GEN
AU  - Rousseau, Sebastien
TI  - Pagsulong ng AI sa pamamagitan ng maraming-anyong LLM: kabatiran mula sa MM1 — Sebastien Rousseau
PY  - 2024
UR  - https://sebastienrousseau.com/fil/2024-03-18-maraming-anyong-llm-kabatiran-mula-sa-mm1/
ER  -

Vancouver

Rousseau S. Pagsulong ng AI sa pamamagitan ng maraming-anyong LLM: kabatiran mula sa MM1 — Sebastien Rousseau. sebastienrousseau.com. 2024 Mar 18. Available from: https://sebastienrousseau.com/fil/2024-03-18-maraming-anyong-llm-kabatiran-mula-sa-mm1/

Chicago

Rousseau, Sebastien. "Pagsulong ng AI sa pamamagitan ng maraming-anyong LLM: kabatiran mula sa MM1 — Sebastien Rousseau." sebastienrousseau.com. March 18, 2024. https://sebastienrousseau.com/fil/2024-03-18-maraming-anyong-llm-kabatiran-mula-sa-mm1/.

APA

Rousseau, S. (2024, March 18). Pagsulong ng AI sa pamamagitan ng maraming-anyong LLM: kabatiran mula sa MM1 — Sebastien Rousseau. sebastienrousseau.com. https://sebastienrousseau.com/fil/2024-03-18-maraming-anyong-llm-kabatiran-mula-sa-mm1/

Muling i-publish ang artikulong ito

Pagsulong ng AI sa pamamagitan ng maraming-anyong LLM: kabatiran mula sa MM1 — Sebastien Rousseau

Ang pag-aaral na MM1 ng Apple hinggil sa paunang pagsasanay ng malalaking modelo ng wikang maraming anyo: ang halong 45/45/10 ng datos, kung bakit mas mahalaga ang resolusyon ng larawan kaysa sa laki ng modelo, at ang papel ng tagakabit ng paningin at wika.

Ang artikulong ito ay nakapailalim sa lisensya ng Creative Commons Attribution 4.0 International. Kailangan ng pagkilala sa canonical URL para sa muling pag-publish.

Pagsulong ng AI sa pamamagitan ng maraming-anyong LLM: kabatiran mula sa MM1 — Sebastien Rousseau

Ang pag-aaral na MM1 ng Apple hinggil sa paunang pagsasanay ng malalaking modelo ng wikang maraming anyo: ang halong 45/45/10 ng datos, kung bakit mas mahalaga ang resolusyon ng larawan kaysa sa laki ng modelo, at ang papel ng tagakabit ng paningin at wika.

Originally published at https://sebastienrousseau.com/fil/2024-03-18-maraming-anyong-llm-kabatiran-mula-sa-mm1/ by Sebastien Rousseau.
Licensed under CC-BY-4.0.