
Pagsulong ng AI sa pamamagitan ng maraming-anyong LLM: kabatiran mula sa MM1
Ang pag-aaral ng Apple sa paunang pagsasanay ng maraming-anyong LLM: ang halo ng datos, ang resolusyon ng larawan, at ang tagakabit ng paningin at wika.
TOPIC
Mga foundation model, multimodal na malalaking language model (Gemini, Gemma, Mistral, MM1), prompt engineering, at ang mga open-source na paglabas na humuhubog sa maitatayo ng mga bangko sa loob ng sarili nilang perimetro ng datos.

Ang pag-aaral ng Apple sa paunang pagsasanay ng maraming-anyong LLM: ang halo ng datos, ang resolusyon ng larawan, at ang tagakabit ng paningin at wika.

Bintana ng konteksto na 32 libong token, punsiyon nang walang internet, at suporta sa maraming wika mula sa isang bagong kompanyang taga-Paris.

Ang Gemma 2B at 7B, ang pagsasanib sa Ollama sa macOS, at ang mga gamit nito sa negosyo mula chatbot hanggang katalinuhan sa kodigo.

Ang arkitekturang Mixture of Experts, ang bintana ng konteksto na 10 milyong token, at ang mga etikal na tanong na kasunod nito.

Inaayos ng prompt engineering ang input ng LLM sa inference time — nang hindi kailangang i-update ang mga timbang. Sinasaklaw ng artikulong ito ang mga teknik na napatunayan sa 2024: zero-shot task framing (Brown et al., 2020), chain-of-thought reasoning (Wei et al., 2022), self-consistency sampling (Wang et al., 2022), ReAct agent loops (Yao et al., 2022), indirect prompt injection risk (Greshake et al., 2023), at mga inilapat na RAG pattern mula sa financial services.

Isang mapagpasiyang taon para sa teknolohiya, sa lipunan, at sa etikal na pag-unlad

Lumipat ang generative AI mula sa pananaliksik patungo sa produksyon noong 2023. Ipinakita ng GPT-4, Claude 2, Llama 2, at Mistral na kaya ng mga large language model na pangasiwaan ang pagsusuri ng legal na dokumento, paglikha ng code, at diyalogo ng customer sa kalidad na katumbas ng tao — na nagdulot ng agarang mga tanong sa pamamahala tungkol sa hallucination, data leakage, at pagsunod sa regulasyon sa mga serbisyong pinansyal.