<bgdev />free

Вход Регистрация

Лаптоп за Deep Learning и Large Language модели
0

0 1 2 3 4 ...45 46 47 48 49 ...90 91 92 93 94

#185409 (ツ) gat3way
Създадено на 09:10 , видяно: 69 пъти.

Дори в момента не може да стъпи на малкия пръст на това което е при цпу-тата.

#185415 (ツ) waldorf
Създадено на 10:27 , видяно: 53 пъти.

Кеша яде мм2 от силикона дето са и на гпу-то карантиите. А те хич не са малко. И явно трябва баланс.

#185416 (ツ) Baj_boeb
Създадено на 10:44 , видяно: 47 пъти.
gat3way

Дори в момента не може да стъпи на малкия пръст на това което е при цпу-тата.

The flagship Nvidia consumer GPU (GeForce RTX 5090) features a total of 117.7 MB of on-die cache, while the largest AMD consumer CPU (Ryzen 9 9950X3D2) features a total of 209.3 MB of on-chip cache.

#185417 (ツ) gat3way
Създадено на 11:05 , видяно: 45 пъти.

А трябва гпу-то да има порядъци повече кеш, защото има и порядъци повече ядра, не мислиш ли? Съвсем отделен въпрос е латентността при цпу кеша и при гпу кеша, треа некъде все да пише за колко цикъла нвидията чете оттам и за колко амд процесора. Още по-отделен въпрос е асоциативността, при цпу-то отива на към на 16-way, оттам може да си представиш как това се отразява ако достъпваш произволни адреси, не такива наредени последователно у паметта.

#185419 (ツ) |
Създадено на 11:41 , видяно: 32 пъти.
waldorf

Тука малко така образователна статия за пишман отворковци със вехти сървърджийници.

https://discretestack.com/blog/on-premise-llm-inference-hardware

Добро е като за рабиняци. Не говори много за новите (те вече не са много нови) тенденции на различни видове disaggregation, няма нищо за KV cache management и т.н.

#185420 (ツ) |
Създадено на 11:46 , видяно: 30 пъти.
Реконструктор

Винаги ми е било супер неясно защо ГПУ-то може да тегли много жици към паметта, а ЦПУ-то не?

И гейта и Ребата са прави. По дълъг път до паметта означава по-ниски битрейтс, по-широка шина означава повече енергия (и проблеми с пиновете на процесора). И после въпроса е какво ще ги правиш всичките тези байтове от тази широка памет на CPU-то, в много случаи отиват на боклука.

В HPC средите това беше важна тема когато навлизаше HBM. Изводите бяха, че не винаги помага. Bandwidth vs. latency and all that.

#185422 (ツ) Baj_boeb
Създадено на 12:34 , видяно: 17 пъти.
gat3way

А трябва гпу-то да има порядъци повече кеш, защото има и порядъци повече ядра, не мислиш ли? .

Еми не му трябва, щото не е цпу и може да скрие изчакването. Всъщност приложението което пишем най-големия му проблем, поне според nsight graphics, е instruction cache thrashing.

#185423 (ツ) gat3way
Създадено на 12:56 , видяно: 11 пъти.

Еми щом могат да превключват warp-ове докато чакат за памет, значи може би изначално не им и трябва толко много кеш. Аааа момент, освен ако нема какво да се превключи щото кода е memory-intensive и всичките чакат за памет, еее тогава става грИдЪ.

#185424 (ツ) |
Създадено на 12:57 , видяно: 9 пъти.
gat3way

Еми щом могат да превключват warp-ове докато чакат за памет, значи може би изначално не им и трябва толко много кеш. Аааа момент, освен ако нема какво да се превключи щото кода е memory-intensive и всичките чакат за памет, еее тогава става грИдЪ.

И се случва, wait for it..., cache thrashing. :)

#185426 (ツ) gat3way
Създадено на 13:12 , видяно: 5 пъти.

Еееем няма угодия, кво да се прави.

0 1 2 3 4 ...45 46 47 48 49 ...90 91 92 93 94

Лаптоп за Deep Learning и Large Language модели
0

AsmBB v3.0 (check-in: 2fb30f0a060190b0); SQLite v3.53.0 (check-in: 4525003a53a7fc63);
©2016..2024 John Found; Licensed under EUPL. Powered by Assembly language Created with Fresh IDE