Arm C1: Acestea sunt noile nuclee care sporesc performanța și inteligența artificială.

  • Noua familie de procesoare Arm C1 (Ultra, Premium, Pro și Nano) cu performanță multi-core cu până la 45% mai mare.
  • SME2 îmbunătățește inteligența artificială pe procesor: îmbunătățiri medii de 3,7x și până la 5x sub sarcini specifice, cu un consum de energie mai mic.
  • C1-DSU permite clustere de până la 14 nuclee, L3 partajat și configurații foarte flexibile.
  • Platforma CSS Lumex: Integrare CPU C1, GPU Mali G1 și suport pentru LPDDR6 de 3nm.

Miezuri braț C1

Noua familie de Miezuri braț C1 marchează o schimbare majoră în ecosistemul dispozitivelor mobile și ultraportabile, înlocuind familiarul Cortex cu o concentrare mai clară pe performanță și eficiență susținute. Această generație vine cu Platforma Lumex și cu un obiectiv evident: accelerarea inteligenței artificiale pe dispozitivul în sine, fără a compromite bateria sau temperatura.

Dincolo de schimbarea numelui, propunerea combină Arhitectura Armv9.3-A, o reproiectare profundă a subsistemului de memorie și o creștere semnificativă a capacităților de calcul matricial. Rezultatul este reprezentat de îmbunătățiri extinse ale performanței, cu un consum redus de energie, precum și de o foaie de parcurs concepută pentru smartphone-uri, tablete, laptopuri și dispozitive portabile.

Arhitectura și noile caracteristici ale nucleelor ​​Arm C1

Arhitectura nucleului Arm C1

Seria C1 este organizată în patru variante: C1-Ultra (performanță maximă), C1-Premium (performanță ridicată într-un spațiu mai mic), C1-Pro (echilibru) și C1-Nano (eficiență maximă). Fiecare producător poate combina aceste blocuri în clustere eterogene pentru a crea SoC-uri adaptate la diferite game și utilizări, cu configurații de până la 14 nuclee.

Arm a modificat atât front-end-ul, cât și back-end-ul, inclusiv îmbunătățiri ale predicției, cache-urilor și execuției în afara ordinii. Datorită noii interconectări și a unui cache partajat (care consumă multă date) mai eficient, Celule SLC), platforma oferă creșteri medii de aproape 15% în utilizările zilnice, care se extind până la +30% pentru încărcături solicitante și ating vârfuri de până la 45% în multicore.

Suportul pentru memorie evoluează odată cu LPDDR6 pentru a reduce consumul de energie și latența, menținând în același timp compatibilitatea cu LPDDR5X la viteze de până la 9600 MT/s. Această bază de memorie, împreună cu reproiectarea clusterului, consolidează performanța susținută și răspunsul la stres termic.

C1-Ultra: plafonul de performanță

Ca nucleu de top, C1-Ultra Acesta vizează SoC-uri emblematice și sarcini cu cerere mare, cum ar fi fotografia computațională, modele mari de inteligență artificială sau jocuri AAA mobile. Comparativ cu Cortex-X925, Arm vorbește despre un... +25% în fir simplu, o cifră care ajută la scalarea performanței generale atunci când este combinată cu mai multe nuclee în cluster.

Frontend-ul îmbunătățește lățimea de bandă a Nivelul 1 al instrucțiunilor și precizia predicției, în timp ce backend-ul crește fereastra de execuție în afara ordinii cu aproximativ 25%, ajungând la aproximativ 2.000 instrucțiuni simultan. În plus, capacitatea de date L1 este dublată la 128 KB, iar viteza de citire L1 este accelerată cu aproximativ 33%.

C1-Premium: performanță ridicată într-un spațiu mai mic

Pentru dispozitive premium care nu necesită maximul absolut, C1-Premium menține o arhitectură foarte apropiată de Ultra, dar cu un Reducere de suprafață cu 35%Este conceput pentru a echilibra performanța și costul, facilitând designuri mai compacte fără a sacrifica cifre semnificative.

C1-Pro: Echilibru și mușchi multi-core

În segmentul central, C1-Pro înlocuiește Cortex-A725 cu un +11% eficiență la același consum și cu îmbunătățiri ale eficienței care ajung cu până la 26% mai puțină energie la aceeași performanțăÎn domeniul jocurilor, Arm menționează profituri de aproximativ + 16% în această clasă de nuclei.

Cheile se află într-un front-end mai capabil (predicție statică rafinată și un BTB mult mai mare) și un backend cu lățime de bandă mai mare în L1D și latență mai mică în L2 atunci când predicția este corectă. Predictorul a fost, de asemenea, reglat pentru a accelera răspunsul în scenarii reale.

C1-Nano: eficiența mai presus de orice

Pentru sarcini ușoare și economii extreme, C1-Nano crește eficiența cu aproximativ 26% comparativ cu predecesorul său (păstrând zona practic intactă, ~+2% față de A520). Etapele de predicție și fetch au fost decuplate pentru a aduce instrucțiunile la L1 mai repede și a reduce așteptările pentru predicțiile eșuate.

În plus, procesare vectorială, unitățile de stocare sunt oprite atunci când pipeline-ul se blochează, iar traficul dintre L3 și DRAM este redus (cu aproximativ 21% în medie și până la 39% sub anumite sarcini), ceea ce reduce consumul și îmbunătățește răspunsul.

C1-DSU: Clustere flexibile și consum redus

Noul C1-DSU orchestrează conexiunea nucleelor ​​sub o memorie cache L3 partajată și face legătura cu restul SoC-ului (RAM, GPU etc.). Comparativ cu iterațiile anterioare, designul reduce consumul tipic de energie al sistemului cu aproximativ 11% și impactul memoriei cu ~7%, bazându-se pe moduri precum L3 Somn rapid pentru a reduce la minimum pierderile atunci când nu sunt utilizate.

O altă piesă cheie este integrarea Acceleratoarele SME2 ca elemente externe nucleului: în C1-Ultra și C1-Premium prezența lor este obligatorie, în timp ce în C1-Pro și C1-Nano Este opțional, în funcție de designul producătorului. Orice nucleu din cluster le poate accesa atunci când sunt prezente, permițând combinații foarte diverse (de exemplu, 2× C1-Ultra + 6× C1-Pro cu unul sau două acceleratoare SME2 sau combinații mai modeste care combină Pro și Nano).

Platforma Lumex include și o nouă generație de GPU-uri. Deși accentul acestei știri se pune pe procesoare, Mali G1 însoțite de îmbunătățiri de ~20% ale performanței grafice, dublează randamentul ray tracing-ului și reduce costurile energetice pe cadru cu aproximativ 9%, consolidând combinația pentru jocurile bazate pe GPU și sarcinile de lucru bazate pe inteligență artificială.

SME2 și rolul procesorului în inteligența artificială

SME2 pe brațul C1

Marele salt în domeniul inteligenței artificiale vine odată cu SME2 (Extensie Matrice Scalabilă 2), care accelerează multiplicările matriceale, multi-predicatele și noile tipuri de date (inclusiv precizii compacte precum 2b/4b) și se coordonează cu SVE2 pentru vectorizare avansată. În cifre agregate, Arm vorbește despre îmbunătățiri medii de 3,7x cu scăderi ale consumului aproape de 27%.

În cazuri practice, compania a demonstrat reduceri ale latenței de de 4,7 ori mai bună recunoaștere vocală (Whisper Base), creșteri ale vitezei de 2,4–2,8x în text în vorbire și creșteri mari în generarea de tokenuri pentru LLM (de exemplu, Gemma 3) care sunt aproape de × 5Rularea pe CPU evită transferurile către alte acceleratoare, ceea ce reduce timpii de așteptare și oferă timp de răspuns.

Pentru sarcini mici sau interactive, CPU-ul ocupă din nou un loc central: cu IMM-uri2Multe sarcini zilnice (îmbunătățirea imaginilor locale, segmentarea, clasificarea, efectele camerei sau sunetul) sunt finalizate mai rapid, cu costuri suplimentare reduse și fără a trece prin rețea. Când cererea crește, GPU-ul sau o unitate de procesare a curentului (NPU) externă poate continua să preia controlul, dar CPU-ul nu mai reprezintă un blocaj.

Este disponibil și suport software: există integrare în Linux și Android 16, lanțuri de instrumente și biblioteci optimizate (KleidiAI) și compatibilitate cu motoare precum Unity și Unreal EngineAcest lucru va facilita adoptarea rapidă a acestor îmbunătățiri de către aplicații și jocuri, odată cu apariția primelor SoC-uri comerciale.

Platforma CSS-ul Lumex pune laolaltă toate piesele (procesorul C1, placa video Mali G1, interconectarea și memoria) cu designuri gata de producție 3 nm, telemetrie hardware și Compatibilitatea sistemului de braț cu LPDDR6. Acest lucru permite partenerilor să își accelereze proiectele mobile și laptop cu clustere scalabile de până la 14 nuclee și capabilități de inteligență artificială pe dispozitiv.

Arm C1 combină performanță susținută, eficiență și un impuls real pentru inteligența artificială pe procesoare datorită SME2; acestea oferă flexibilitatea C1-DSU pentru a adapta clusterele la fiecare gamă de produse și constituie o bază solidă pentru următorul val de SoC-uri mobile și portabile care urmăresc să echilibreze puterea, autonomia și capacitățile inteligenței artificiale fără a depinde întotdeauna de cloud.

RISC-V SoC Sophgo
Articol conex:
SOPHGO SG2000/SG2002: SoC pentru AI cu nucleu RISC-V + ARM

Adăugați ca sursă preferată în Google