486 열여섯 대로 슈퍼컴퓨터를 만든 베오울프가, 집에서 LLM을 돌리는 지금 돌아왔다

컴퓨터를 여러 대 사서 하나로 묶는 일은 오래도록 기업과 연구소만 하던 것이었다. 1994년에 그것이 누구나 따라 할 수 있는 형태로 열렸고, 2026년에 같은 일이 다시 벌어지고 있다.

컴퓨터를 여러 대 갖는 것과는 다른 얘기다. 애플II, 아미가, NeXT를 모으는 사람은 예전부터 있었지만 그건 N대를 N번 쓰는 것이다. 여기서 말하는 것은 여러 대가 한 대처럼 한 문제에 붙는 것이고, 그러려면 기계끼리 이야기하게 만드는 코드가 있어야 한다.

1994년 베오울프(Beowulf)도 NASA의 연구 프로젝트로 시작했다. 그런데 그 프로젝트가 남긴 것은 기계가 아니라 조립법이었다. 부품은 시중에서 살 수 있는 것이었고 소프트웨어는 공개였고 만드는 방법을 문서로 뿌렸다. 그전까지 슈퍼컴퓨터는 복제할 수 없는 물건이었는데, 이때부터 따라 만들 수 있는 것이 됐다.

지금 DGX Spark를 2대씩, 많게는 8대씩 사서 묶는 사람들에게서 같은 구조가 보인다.

1994년: 베오울프는 무엇이었나

왜 만들었나

NASA 고다드 우주비행센터(Goddard Space Flight Center)에는 지구를 찍는 위성이 있었고, 그 위성이 쏟아내는 데이터를 분석해야 했다. 프로젝트가 받은 목표는 1997년까지 테라플롭스급이었는데, 1993년에 연구자들이 실제 코드로 내던 것은 수 기가플롭스였다. 그해 세계에서 가장 빠른 기계도 170기가플롭스였으니 목표는 다음 제품 하나 건너뛰면 닿는 자리가 아니었다.

문제는 그때 살 수 있던 물건이었다. 병렬 기계는 이미 있었지만 CM-5, Paragon, T3D, MasPar가 저마다 메모리 모델도 컴파일러도 메시지 전달 방식도 달랐다. 한 업체에서 다른 업체로 옮기는 것이 다시 컴파일하는 정도의 일이 아니었다. 워크스테이션 한 대가 사용자 한 명당 5만 달러였고 시스템은 자주 죽었다. 한 번 죽으면 돌아가던 작업이 전부 처음부터였고 재부팅에만 삼십 분이 걸렸다.

덜 알려진 이유가 하나 더 있다. ESS 프로젝트 관리자였던 James Fischer의 회고에 따르면, 여러 팀에서 들어오는 코드를 업체별 시스템에 얹어 두면 그 시스템 수명마다, 흔히 3년이 못 되어, 전부 다시 이식해야 했다. 업체가 바뀌어도 남는 환경이 필요했다.

그래서 Thomas Sterling과 Donald Becker가 세운 목표가 이랬다. 5만 달러 안에서 최고 성능 초당 10억 번 연산(1 Gops). 전용 프로세서도 전용 인터커넥트도 쓰지 않고, 시중에서 파는 PC 메인보드와 이더넷만으로. PC를 고른 이유는 프로세서 한 개가 싸서가 아니라, 대중 시장 덕분에 메인보드와 디스크를 통째로 싸게 살 수 있어서였다.

그런데 목표에 하나가 더 있었고, 그게 이 글에서 제일 중요하다. 베오울프는 여럿이 나눠 쓰라고 만든 기계가 아니었다. 논문이 직접 그렇게 적는다. 대부분의 분산 컴퓨팅 시스템이 여러 사용자를 위한 범용 환경인 반면 베오울프는 한 사람의 작업을 위해 설계됐고, 연구자가 키보드와 모니터를 직접 붙여 쓰는 기계라는 것이다. 큰 임시 데이터를 자기 기계에 쌓아 두어 공용 파일 서버와 네트워크에 걸리는 부하를 덜고 응답 시간을 끌어올리는 것이 목적이었다. 줄 서서 쓰던 것을 자기 책상에 두려던 것이다.

무엇을 만들었나

첫 결과물의 구성은 1995년 ICPP 논문 "BEOWULF: A Parallel Workstation for Scientific Computation"에 남아 있다. 저자는 Becker와 Sterling을 포함해 여섯 명이다. 이름은 즉흥이었다. 관리자가 전화로 이름을 대라고 하자 Sterling이 사무실에 있던 고대 영어 서사시를 집어 들었고, 첫 기계에는 그 시에서 끝까지 곁을 지킨 젊은 전사의 이름 Wiglaf를 붙였다.

항목 Wiglaf
노드 PC 16대
CPU Intel 486 DX4, 100 MHz
노드당 16 MB, 모두 합쳐 256 MB
디스크 노드당 0.5 GB
네트워크 10 Mbps 이더넷 두 망. 하나는 허브에 각 노드를 따로 잇는 방식(10baseT), 하나는 얇은 동축 케이블 한 줄에 노드를 줄줄이 매다는 방식(10base2)
입출력 모니터 2대와 키보드 1개

비용은 이 표의 출처가 아니라 같은 팀의 다른 논문에 나온다.

이건 1995년 논문이 측정한 시점의 구성이다. 첫 조립은 1994년 여름이었고, 1999년 CESDIS 회고 페이지에는 디스크가 540 MB 또는 1 GB, 랜카드가 노드당 세 개로 적혀 있다. 그 사이 시스템에 손을 댔다는 뜻이라, "1994년 최초 부품 목록"으로 읽으면 안 된다.

부품 목록에 특별한 것이 하나도 없다는 게 요점이었다. 같은 팀이 그해 HPDC에서 발표한 통신 오버헤드 논문은 결론에서 이렇게 정리한다. 최고 성능 1 Gops를 고급 워크스테이션 가격대 안에서 구현할 수 있으며, 시제품 전체 비용은 약 4만 달러였다.

다만 그것은 최고 성능이다. Wiglaf가 실제 유체 시뮬레이션에서 지속적으로 낸 것은 60메가플롭스였다. 목표였던 지속 1기가플롭스는 1996년에 펜티엄으로 만든 클러스터들이 5만~6만 달러에 넘겼다. 첫 기계가 낸 것은 목표의 17분의 1이었다.

그런데 논문은 그 60메가플롭스를 당대 슈퍼컴퓨터와 견준다. 프로세서 수를 16개로 똑같이 맞췄을 때, Intel Paragon 그리고 벡터 칩을 뺀 Thinking Machines CM-5와 비슷했다는 것이다. Cray T3D는 Beowulf보다 빨랐지만 그 차이가 2.5배에 못 미쳤다. 클러스터 전체가 아니라 같은 규모끼리의 비교다. 4만 달러짜리 486 열여섯 대가 그 자리에 있었다.

값을 옆에 놓으면 그 자리가 보인다. 같은 시기 NCAR가 들인 CM-5는 32노드에 147만 달러였고, NCAR는 노드 하나에 4만 6천 달러라고 직접 적어 두었다. Wiglaf는 열여섯 대를 다 합쳐 4만 달러였다. CM-5 노드 한 개 값이 Wiglaf 전체보다 비쌌다.

1994~95년, 얼마나 크고 얼마나 비쌌나두 축 모두 로그. 기울어진 점선은 계산 단위 한 개에 같은 값이 드는 선이다.한 개에 2,500달러한 개에 1만 달러한 개에 5만 달러1632641282565121024대표 구성의 계산 단위 수 (프로세서 · 노드 · PE)5만$10만$50만$100만$500만$1000만$대표 구성 총액Beowulf Wiglaf16 프로세서 · 4만 달러 · 대당 2,500달러TMC CM-532 노드 · 147만 달러 · 노드당 4만 6천IBM SP-264 노드 · 508만 달러 · 노드당 7만 9천Cray T3D256 PE · 약 900만 달러 · PE당 3만 5천Intel Paragon XP/S 1501,024 노드 · 1,600만 달러 · 노드당 1만 6천Paragon 이 비싼 것은 크기 때문이다. 계산 단위 하나로 내리면 Wiglaf 의 여섯 배다. CM-5 는 열여덟 배다.1995년 ICPP 논문은 같은 프로세서 수에서 Beowulf 가 Paragon, 벡터 칩을 뺀 CM-5 와 견줄 만했고 Cray T3D 는더 빨랐지만 그 차이가 2.5배에 못 미쳤다고 적었다.
성능은 축에 넣지 않았다. Beowulf 만 실측치이고 나머지는 사양상의 최고치라 한 축에 놓으면 오히려 오해를 부른다. CM-5 값은 벡터 유닛이 달린 노드 기준이다.

그들이 만든 것은 소프트웨어였다

Becker가 한 일을 "거대한 드라이버 하나를 썼다"로 정리하면 실제와 다르다. 그가 만든 것은 수많은 드라이버다. 3Com 3c509용 3c509.c는 1996년 리눅스 소스 기준 539줄이다. 중요한 건 코드 길이가 아니라 지원 범위였다. Ethernet-HOWTO는 그를 두고 "현재 리눅스에서 쓸 수 있는 이더넷 카드 드라이버를 많이 작성한 데 감사해야 할 사람"이라고 적는다.

채널 본딩은 더 직접적인 사례다. 랜카드 여러 장을 운영체제에는 한 장처럼 보이게 묶어서 통로를 넓히는 기법이다. 100 Mbps 이더넷은 아직 비쌌고, 486 여러 대가 쏟아내는 통신량을 10 Mbps 한 줄로는 감당할 수 없었다. 그래서 10 Mbps 망을 두 개 나란히 놓았다. 구현은 요즘의 LACP 같은 표준이 아니었다. 한 랜카드의 MAC 주소를 다른 랜카드에 복사하고, 들어온 패킷이 하나의 가상 인터페이스에서 온 것처럼 운영체제에 보이게 하고, 내보낼 때는 두 큐에 번갈아 넣는 단순한 방식이었다. 그렇게 해서 포화 상태에서 두 망이 한 망보다 70% 높은 대역폭을 냈다. 다만 조건이 있었다. 늘어난 대역폭은 메시지 개수보다 메시지 크기에 훨씬 민감했다.

왜 하필 리눅스였느냐가 여기서 갈린다. 무료여서가 아니라 커널을 고칠 수 있어서였다. 랜카드 두 장을 하나처럼 보이게 만들려면 드라이버 층에 손을 대야 했고, 논문은 그것이 리눅스 커널 소스를 자유롭게 볼 수 있었던 덕분이라고 적는다. Sterling도 그때를 이렇게 회고한다. "소스 코드를 손에 넣을 수 있는 소프트웨어가 필요했다."

지금도 리눅스 본딩 드라이버 문서는 첫 줄에서 자기 뿌리를 밝힌다. "The bonding driver originally came from Donald Becker's beowulf patches for kernel 2.0."

벤더는 반대하지 않았다, 다만 늦었다

벤더가 적대적이었다고 부풀리면 안 된다. Intel이나 3Com이 베오울프에 반대했다는 1차 자료는 찾지 못했다. 486 DX4는 그냥 많이 팔린 PC용 CPU였고, NASA가 그것을 계산 노드로 가져다 쓴 것뿐이다.

대신 리눅스 지원이 벤더보다 사용자 쪽에서 먼저 나왔다는 점만은 뚜렷하다. 1996년 4월 커널 패치에 담긴 3c509.c 헤더가 이미 "Written 1993-1995 by Donald Becker"이고, 지금 커널의 같은 파일에도 "Written 1993-2000 by Donald Becker"가 그대로 남아 있다.

3Com이 자기 리눅스 드라이버를 처음 내놓은 것은 1999년 9월이다. 리눅스용 3c509 드라이버가 나온 지 여섯 해 뒤였다. 다만 그 드라이버는 3c509가 아니라 나중 PCI 제품군(3C905B 등)용이었으니, 3Com이 자기 카드용 드라이버를 6년간 방치했다는 뜻으로 읽으면 안 된다. 정확히 말하면 벤더가 리눅스를 공식 상대로 인정하는 데 그만큼 걸렸다. 그런데 발표를 어디로 보냈는지가 사정을 더 잘 보여 준다. 3Com 직원이 보낸 발표 메일의 수신처는 [email protected], 곧 NASA 고다드가 굴리던 메일링 리스트였다.

3Com이 최신 EtherLink 10/100 PCI 랜카드용 리눅스 드라이버(3c90x)를 개발했음을 알리게 되어 기쁩니다. 이것은 우리가 리눅스 세계로 내딛는 첫걸음 가운데 하나이고, (중략) 우리는 Donald Becker와 함께 작업해 그의 3C59x 드라이버와의 호환성을 확보했습니다.

(3Com, John H. Harrison, 1999-09-14)

같은 주 리눅스 소식지 LWN(Linux Weekly News)의 보도는 이렇게 시작한다. "3Com이 처음으로 자기 리눅스 드라이버를 실제로 내놓았다." 그리고 3Com이 Becker의 공을 크게 인정하고 있다고 덧붙인다. 벤더가 들어올 때는 이미 사용자들이 깔아 놓은 판 위였다.

퍼진 것은 기계가 아니라 조립법이었다

베오울프에는 복제해야 할 독점 하드웨어가 없었다. 그래서 퍼뜨릴 것은 만드는 방법뿐이었고, 그들은 실제로 그렇게 했다.

0200400600 624 199819992000
베오울프 메일링 리스트 월별 글 수. 1997년 초 두세 건에서 1999년 5월 624건까지 간다.

NASA가 이 프로젝트에 붙인 인력은 4년 내내 한 해 네 명 정도였다. 그런데 그 뒤로 프로젝트는 제 발로 굴러가기 시작했고, NASA는 이끄는 쪽이 아니라 여러 참여자 가운데 하나가 되었다고 스스로 회고한다.

그것으로 무엇을 풀었나

논문이 성능을 측정한 코드는 두 개다. 하나는 Prometheus라는 2차원 압축성 유체 코드로, 격자를 128×128 타일로 쪼개고 타일 사이는 시간 단계마다 두 번만 이야기하게 만들었다. 이 코드는 원래 IBM SP-1과 Intel Paragon에서 돌던 것인데 Beowulf로 쉽게 옮겨졌다고 적혀 있다. 업체가 바뀌어도 남는 환경을 원했던 이유가 여기서 드러난다.

다른 하나는 중력을 계산하는 N체 트리 코드다. 별이 태어나는 성간운의 구조를 보는 데 쓰였고, 1994년 7월 목성에 부딪힌 슈메이커-레비 9 혜성이 부서지는 과정을 모형으로 만드는 데도 쓰였다. 그해 여름 조립된 기계가 그해 여름의 사건을 계산하고 있었다.

소프트웨어는 여기저기서 가져다 붙였다

"베오울프"라는 이름의 소프트웨어 패키지는 없었다. 당시 FAQ부터가 그렇게 적는다. 여러 대학과 연구소가 이미 만들고 있던 공개 소프트웨어를 모아 붙인 느슨한 묶음이었다.

무엇 누가 만들었나
운영체제 리눅스와 GNU 툴체인 공개 소스
랜카드 드라이버 3c509 등 이더넷 드라이버 다수 Becker
링크 묶기 채널 본딩 패치 Becker
메시지 전달 PVM (1989년 ORNL 시작, 1993년 PVM3) 대학과 연구소
메시지 전달 MPICH, LAM/MPI (1996년 무료 공개) Argonne, Ohio Supercomputer Center
작업 배분 PBS, DQS, Condor 필수는 아니었음
노드 관리 rsh 스크립트에서 BProc, BeoSetup으로 이후 세대
부팅 BOOTP/TFTP에서 BeoBoot으로 이후 세대

Sterling과 Becker가 PVM이나 MPI를 발명한 것이 아니다. 1995년 논문 시점에는 PVM을 쓰고 있었고 MPI는 "곧 옮길 예정"이라고 적혀 있다. 흔히 베오울프 하면 디스크 없는 노드를 떠올리지만 그것도 초기 Wiglaf의 특징은 아니다. Wiglaf 노드에는 각각 로컬 디스크가 있었고, 노드를 얇게 만드는 방식은 뒤의 Scyld 계열에서 체계가 잡혔다.

그래도 못 없앤 것

묶는 코드를 아무리 잘 써도 사라지지 않는 것이 있었다. 같은 팀이 통신 오버헤드를 뜯어본 논문에 이런 대목이 있다.

놀랍게도 문제 크기를 고정한 PPM 코드에서는 상황이 더 나쁘다. 프로세서 16개에서 오버헤드가 60%를 넘는다. 그런데 이 경우 오버헤드는 통신 시간 때문이 아니다. 통신 루틴에 들어간 시간을 다 합쳐도 전체 실행 시간의 1%뿐이다. 오버헤드의 대부분은 각 시간 단계가 끝날 때 프로세서들이 서로를 기다리는 동기화가 잡아먹는 것으로 보인다.

같은 논문은 망을 늘려도 소용없다는 것까지 실험으로 확인했다. 두 망을 쓴 효과가 PPM 코드에서는 거의 없었는데, 통신에 쓰는 시간이 애초에 1%를 넘지 않기 때문이다. 선을 굵게 해도 기다리는 시간은 줄지 않는다. 여러 대를 묶는다는 것이 그냥 대수를 더하는 일이 아니라는 뜻이다.

학생들이 지하실에 만든 베오울프

조립법이 열려 있었다는 말의 끝은 여기다. 연구소도 대학 전산실도 아닌 곳에서 그것을 만든 사람들이 있었다.

지하실 철제 선반에 베이지색 PC 본체가 빼곡히 꽂혀 있고 CRT 두 대가 켜져 있다
Kieran Huggins, Ye Olde Beowulf (circa 2000), CC BY 2.0.

사진을 촬영한 사람이 남긴 설명이 이 글이 하려는 말을 대신한다.

대학 때 룸메이트 몇 명과 이 클러스터를 만들었다. 그게 전기 요금에 무슨 짓을 하는지는 그때 아무 생각이 없었지만 정말 재미있었다. 몇백 달러 예산으로 만들었고 전부 낡은 486 DX였다. 대부분 ReBoot에서 가져온 컴팩과 IBM의 기업 퇴역 워크스테이션이었다. 그때 막 나온 1GHz 기계 한 대 정도의 성능이었는데, 커널을 컴파일하고 SETI 패킷을 돌렸지만 대개는 그냥 돌아가는 걸 보는 게 좋았다. 지하실에 한두 해 두었다가 결국 내다 버렸다. 자리를 꽤 차지했지만 지하실은 잘 데워 줬다. 그립다.

같은 486 DX다. NASA가 열여섯 대에 4만 달러를 쓴 지 여섯 해 만에, 학생 몇이 회사가 버린 것을 주워다 몇백 달러로 같은 것을 만들었다. 그리고 그것으로 커널을 컴파일했다. 조립법이 퍼진다는 것이 이런 뜻이다.

이 사진은 2026년 6월에 X에서 다시 돌았다. 28만 번 읽혔고, 거기 달린 답글 하나가 이 글이 하려는 말을 먼저 해 버렸다.

그때 맞았던 말이 지금도 맞다. 26년이 지난 지금 분산 컴퓨팅으로 할 수 있는 일은 놀랍다. llama.cpp의 RPC 기능 덕분에 허깅페이스에 있는 거의 아무 모델이나 분산 추론 클러스터로 돌릴 수 있다.

And it was as true then as it is now. The things we can do with distributed computing 26 years later are incredible. We owe a lot to @ggerganov for llama.cpp, and the RPC feature lets us build clusters for distributed LLM inference with just about any model you can find on @huggingface

@ArcadianComp · 2026-06-17

이름이 그대로 남아 있기도 하다. Jeff Geerling이 여러 대를 묶어 모델을 돌리는 도구들을 시험하려고 만든 저장소 이름이 beowulf-ai-cluster다.

그러니까 1994년 이야기는 1994년에 끝나지 않았다. 지금 벌어지는 일을 보자.

2026년: 같은 일이 벌어지고 있다

집에서 돌아갈 리 없던 것들

이렇게 되기까지 몇 년이 걸렸다.

2024년 여름 메타가 Llama 3.1 405B(4천억 파라미터)를 공개했을 때, 그걸 집에서 돌린다고 생각한 사람은 거의 없었다. 숫자를 보면 왜인지 분명하다. 원본 체크포인트가 812GB다. 그때 개인이 살 수 있던 가장 큰 그래픽카드는 24GB짜리였으니 서른네 장을 꽂아야 했고, 통합 메모리가 가장 큰 컴퓨터는 192GB짜리 맥 스튜디오였으니 네 대를 묶어야 했다. 4비트로 낮춰도 203GB라 그 한 대에 들어가지 않았다. 담을 자리가 아예 없었다. 오픈웨이트라는 말은 "받을 수는 있다"는 뜻이었지 "쓸 수 있다"는 뜻이 아니었다.

그런데 그 옆에서 두 갈래로 발전이 쌓였다.

하나는 모델을 줄이는 쪽이다. 출발점은 2023년 3월 Georgi Gerganov가 내놓은 llama.cpp였다. GPU 없이 노트북 CPU만으로 Llama를 돌려 보려고 만든 것인데, 여기서 나온 GGUF 형식과 양자화 방식이 개인이 모델을 돌리는 기본 도구가 됐다. 그 뒤로 맥북에서 작은 모델이라도 돌려 보려던 사람들이 양자화를 해마다 정교하게 다듬었다. 같은 모델을 절반, 4분의 1 크기로 줄이면서 품질을 어디까지 지킬 수 있는지가 계속 갱신됐다. 모델 이름 뒤에 붙는 2비트니 4비트니 하는 말이 전부 그 계보다.

다른 하나는 모델 구조 자체다. 전문가 혼합(MoE) 방식이 자리를 잡으면서, 전체는 거대한데 토큰 하나를 뽑을 때 실제로 읽는 양은 훨씬 적은 모델이 나왔다. DeepSeek V4 Flash가 284B(2,840억 파라미터)인데 토큰 하나에 쓰는 것은 13B(130억)뿐인 식이다. 대역폭이 좁아도 감당된다.

다만 담아 둘 공간은 줄지 않는다. 지금 안 읽는 전문가도 다음 토큰에 불릴지 모르니 가중치는 전부 메모리에 올라가 있어야 한다. 그래서 이 판의 병목이 둘로 갈린다. 얼마나 빨리 읽느냐와 얼마나 담을 수 있느냐다. 전문가 혼합은 앞의 것을 풀어 줬고 뒤의 것은 그대로 남겼다. 여러 대를 사서 묶는 이유가 여기 있다.

하드웨어는 반대편에서 왔다. 애플이 통합 메모리로 512GB를 내놓았고, AMD가 128GB짜리 미니 PC를 만들었고, NVIDIA가 DGX Spark를 냈다. 담을 공간이 커진 것이 핵심이다. 전문가 혼합은 담아 둘 자리를 요구하지 매 순간 빠른 읽기를 요구하지는 않으니, 이 조합이 때마침 맞아떨어졌다.

그리고 이 컴퓨터들에는 서로를 잇는 포트가 처음부터 달려 나왔다. DGX Spark에는 ConnectX-7 200Gb/s가 들어 있고, 맥에는 썬더볼트 5가 있다. 애플은 2025년 12월 macOS 26.2부터 썬더볼트를 통한 RDMA를 공식 지원하기 시작했다. 다른 기계의 메모리를 운영체제를 거치지 않고 직접 읽고 쓰는 방식으로, 원래 데이터센터 인터커넥트의 기법이다. 그것이 책상 위 컴퓨터의 일반 포트에 들어왔다.

그리고 이것들은 묶을 수 있다. Spark 8대면 1TB이고, 512GB 맥 4대면 2TB다. 실제로 그 규모로 굴리는 사람들이 있다. Kimi K3 원본을 GB10 16대에 올려 돌린 기록도 공개돼 있다.

그렇다고 다 되는 것은 아니다. Llama 3.1 405B를 원본 그대로 올리려면 812GB가 필요하고, DeepSeek V4 Pro는 893GB, Kimi K3는 1.56TB다. 지금 오픈웨이트 2위인 Qwen3.8 2.4T는 4.9TB라 서른여덟 대를 묶어야 한다. 물론 정밀도를 낮추면 줄어든다. GLM-5.2는 원본이 1.5TB인데 4비트로 내리면 376GB라 512GB 맥 한 대에 얹힌다. 그때는 품질을 어디까지 버린 것인지가 다시 문제가 된다.

그러니 지금 벌어진 일을 정확히 말하면 이렇다. 모든 모델이 집에 들어온 것이 아니라, 쓸 만한 축에 드는 모델 하나가 DGX Spark 2대짜리 구성에 들어왔다. 아래 그래프에서 가장 굵게 찍힌 점이 그것이고, 사람들이 2대를 사는 이유도 거기 있다.

0200GB400GB600GB800GB1TB1200GB1400GB1600GB1800GB2TB202420252026Spark 2대 256GBSpark 4대 · 맥 1대 512GBSpark 8대 1TBSpark 16대 · 맥 4대 2TB컴퓨터 한 대로는 담을 수 없는 크기한 대로 살 수 있는 최대Llama 3 70BLlama 3.1 405B405B, 4비트로 낮춰도DeepSeek R1Kimi K3 원본Kimi K3 2비트DeepSeek V4 ProDeepSeek V4 Flash같은 모델 2비트하드웨어Mac Studio M2 Ultra192GBRTX 509032GBMac Studio M3 Ultra512GB · 819GB/sDGX Spark128GB · ConnectX-7macOS 26.2썬더볼트 RDMAMac Studio M5 Ultra512GB · 1.2TB/s
위는 모델이 요구하는 메모리, 아래는 하드웨어가 나온 시점이다. 회색은 컴퓨터 한 대로 담을 수 없는 크기다.

그 사이에 DeepSeek R1이 있었다. 2025년 1월에 추론 모델이 통째로 열렸는데 원본이 689GB였다. 405B 때와 똑같이 집에는 그걸 올려 둘 메모리가 없었다. 그런데 이번에는 사람들이 그냥 넘어가지 않았다.

되는지부터 확인해 보는 실험이 줄줄이 나왔다. 그래픽카드를 아예 빼고 서버용 CPU와 램만으로 돌린 사람들이 있었다. 중고 EPYC 7702에 512GB 램을 꽂은 2,000달러짜리 조립기에서 4비트 R1이 초당 3.5에서 4.25토큰으로 돌았다. 일주일 뒤에는 6,000달러짜리 듀얼 EPYC에 DDR5 768GB를 꽂아 8비트 원본 700GB를 통째로 올리고 초당 6에서 8토큰을 냈다. 쓸 만한 속도가 아니다. 그래도 된다는 것을 보였다.

두 달 뒤 애플이 통합 메모리 512GB짜리 맥 스튜디오를 냈다. 같은 4비트 R1이 404GB로 그 한 대에 들어갔고 초당 17에서 18토큰이 나왔다. 소비 전력은 200W 아래였다. 랙에 세워야 하던 것이 책상 위 컴퓨터 한 대가 됐고 속도는 네 배가 됐다.

이 두 달이 이 판의 성격을 그대로 보여 준다. 안 될 것을 굳이 되게 만들어 본 사람들이 먼저 있었고, 그다음에 그것을 실제로 쓸 수 있게 만드는 컴퓨터가 나왔다. 순서가 반대였다면 그 512GB는 그냥 비싼 맥이었을 것이다.

405B 때와 결정적으로 다른 점이 여기다. 2024년에는 메모리가 모자란다는 사실 앞에서 이야기가 끝났다. 2025년에는 그 자리가 생겼다.

그리고 7월 31일 DeepSeek V4 Flash가 한 방을 더했다. 공개일을 붙여 DS4F 0731이라고들 부른다. 이날 하드웨어는 전날과 똑같았다. 대역폭도 메모리도 그대로다. 바뀐 것은 그 위에 올릴 것이었고, 그것만으로 이미 팔린 장비의 값어치가 다시 매겨졌다.

충격의 크기는 크기와 점수를 같이 놓고 봐야 보인다. Artificial Analysis Intelligence Index로 보면 클로즈드 최상단이 63점이고, 오픈웨이트 최상단은 60점(Kimi K3)이다. 그런데 그 60점짜리는 1.56TB라 Spark 12대를 묶어야 한다. 반면 DS4F는 52점을 167GB에 담았다. Spark 2대면 된다.

52점이 무슨 뜻인지는 옆에 놓고 보면 분명하다. 같은 시기 상용으로 팔리는 GPT-5.6 Luna가 52점이다. 집에 있는 컴퓨터 2대가 돈 받고 파는 모델과 같은 점수를 낸다. 물론 여전히 최상단과는 11점 차이고, 아홉 개 평가를 합친 값이라 점수 차이가 곧 효용 차이는 아니다. 그래도 "로컬은 장난감"이라는 말은 2023년의 사실이지 지금의 사실이 아니다.

여덟 대로도 못 담는다2대 안 · 50점 위010203040506050Intelligence Index1대128GB2대256GB4대512GB8대1024GB16대2048GB32대4096GB16GB32GB64GB원본 체크포인트를 올리는 데 필요한 메모리 · DGX Spark 기준 대수 (로그 눈금)중국그 밖272개 · 점에 마우스를 올리면 이름이 나온다Qwen3.8 2.4T A95BQwen3.8 2.4T A95B · Alibaba · 4892 GB · 57.7점LongCat 2.0LongCat 2.0 · LongCat · 3552 GB · 34.0점Ling-1TLing-1T · InclusionAI · 1999 GB · 12.7점Ring-1TRing-1T · InclusionAI · 1999 GB · 16.3점InklingInkling · Thinking Machines · 1905 GB · 42.3점Kimi K3Kimi K3 · Kimi · 1561 GB · 59.7점GLM-5GLM-5 · Z AI · 1508 GB · 40.6점GLM-5.1GLM-5.1 · Z AI · 1508 GB · 41.0점GLM-5.2GLM-5.2 · Z AI · 1507 GB · 52.6점Nemotron 3 Ultra 550B A55BNemotron 3 Ultra 550B A55B · NVIDIA · 1121 GB · 38.3점Ling-2.6-1TLing-2.6-1T · InclusionAI · 1042 GB · 26.6점Ring-2.6-1TRing-2.6-1T · InclusionAI · 1042 GB · 31.7점MiMo-V2.5-ProMiMo-V2.5-Pro · Xiaomi · 1033 GB · 42.9점Kimi K2Kimi K2 · Kimi · 1029 GB · 19.7점Kimi K2 0905Kimi K2 0905 · Kimi · 1029 GB · 24.0점Qwen3 Coder 480B A35B InstructQwen3 Coder 480B A35B Instruct · Alibaba · 960 GB · 18.2점Arctic InstructArctic Instruct · Snowflake · 957 GB · 3.0점MiniMax M1 40kMiniMax M1 40k · MiniMax · 912 GB · 14.5점MiniMax M1 80kMiniMax M1 80k · MiniMax · 912 GB · 17.9점DeepSeek V4 Pro 0813DeepSeek V4 Pro 0813 · DeepSeek · 893 GB · 53.2점DeepSeek V4 ProDeepSeek V4 Pro · DeepSeek · 865 GB · 45.3점MiniMax-M3MiniMax-M3 · MiniMax · 854 GB · 45.4점Llama 3.1 Instruct 405BLlama 3.1 Instruct 405B · Meta · 812 GB · 8.3점Hermes 4 - Llama-3.1 405BHermes 4 - Llama-3.1 405B · Nous Research · 812 GB · 8.8점Llama 3.1 Tulu3 405BLlama 3.1 Tulu3 405B · Allen Institute for AI · 812 GB · 8.1점Qwen3.5 397B A17BQwen3.5 397B A17B · Alibaba · 807 GB · 34.3점Llama 4 MaverickLlama 4 Maverick · Meta · 803 GB · 14.5점Trinity Large ThinkingTrinity Large Thinking · Arcee AI · 797 GB · 18.7점Jamba 1.7 LargeJamba 1.7 Large · AI21 Labs · 797 GB · 5.0점Jamba 1.6 LargeJamba 1.6 Large · AI21 Labs · 797 GB · 4.7점Jamba 1.5 LargeJamba 1.5 Large · AI21 Labs · 797 GB · 4.8점Nex-N2-ProNex-N2-Pro · Nex AGI · 794 GB · 41.7점GLM-4.5GLM-4.5 · Z AI · 717 GB · 19.7점GLM-4.7GLM-4.7 · Z AI · 717 GB · 34.5점A.X-K2A.X-K2 · SK Telecom · 694 GB · 35.0점DeepSeek V3.2 ExpDeepSeek V3.2 Exp · DeepSeek · 690 GB · 25.9점DeepSeek V3.2 SpecialeDeepSeek V3.2 Speciale · DeepSeek · 690 GB · 22.6점DeepSeek V3.2DeepSeek V3.2 · DeepSeek · 690 GB · 32.8점DeepSeek V3.1 TerminusDeepSeek V3.1 Terminus · DeepSeek · 689 GB · 31.4점DeepSeek R1 (Jan '25)DeepSeek R1 (Jan '25) · DeepSeek · 689 GB · 18.6점DeepSeek V3.1 (Non-reasoning)DeepSeek V3.1 (Non-reasoning) · DeepSeek · 689 GB · 21.4점DeepSeek V3 (Dec '24)DeepSeek V3 (Dec '24) · DeepSeek · 689 GB · 14.2점DeepSeek V3 0324DeepSeek V3 0324 · DeepSeek · 689 GB · 15.2점DeepSeek R1 0528 (May '25)DeepSeek R1 0528 (May '25) · DeepSeek · 689 GB · 20.4점Mistral Large 3Mistral Large 3 · Mistral · 682 GB · 15.9점ERNIE 4.5 300B A47BERNIE 4.5 300B A47B · Baidu · 601 GB · 8.9점Hy3-previewHy3-preview · Tencent · 598 GB · 34.4점Hy3Hy3 · Tencent · 598 GB · 42.2점Kimi K2.6Kimi K2.6 · Kimi · 595 GB · 45.1점Kimi K2.7 CodeKimi K2.7 Code · Kimi · 595 GB · 43.0점Kimi K2.5Kimi K2.5 · Kimi · 595 GB · 36.0점Kimi K2 ThinkingKimi K2 Thinking · Kimi · 594 GB · 33.5점Grok 2 (Dec '24)Grok 2 (Dec '24) · SpaceXAI · 539 GB · 7.8점Inkling SmallInkling Small · Thinking Machines · 532 GB · 41.2점Llama 3.1 Nemotron Ultra 253B v1Llama 3.1 Nemotron Ultra 253B v1 · NVIDIA · 507 GB · 8.9점Solar Open2 250BSolar Open2 250B · Upstage · 501 GB · 37.4점Mistral Large 2 (Jul '24)Mistral Large 2 (Jul '24) · Mistral · 490 GB · 7.0점K-EXAONEK-EXAONE · LG AI Research · 474 GB · 22.5점DeepSeek-V2-ChatDeepSeek-V2-Chat · DeepSeek · 472 GB · 3.3점DeepSeek-V2.5DeepSeek-V2.5 · DeepSeek · 472 GB · 6.4점DeepSeek-Coder-V2DeepSeek-Coder-V2 · DeepSeek · 472 GB · 4.7점DeepSeek-V2.5 (Dec '24)DeepSeek-V2.5 (Dec '24) · DeepSeek · 472 GB · 6.5점Qwen3 VL 235B A22BQwen3 VL 235B A22B · Alibaba · 471 GB · 20.9점Qwen3 235B A22B 2507 InstructQwen3 235B A22B 2507 Instruct · Alibaba · 470 GB · 18.4점Qwen3 235B A22BQwen3 235B A22B · Alibaba · 470 GB · 13.5점Qwen3 235B A22B 2507Qwen3 235B A22B 2507 · Alibaba · 470 GB · 19.9점Command A+Command A+ · Cohere · 438 GB · 22.8점Sarvam 105BSarvam 105B · Sarvam · 424 GB · 11.9점Step 3.7 FlashStep 3.7 Flash · StepFun · 403 GB · 30.9점Step 3.5 FlashStep 3.5 Flash · StepFun · 399 GB · 26.0점MiMo-V2.5MiMo-V2.5 · Xiaomi · 315 GB · 38.0점MiMo-V2-Flash (Feb 2026)MiMo-V2-Flash (Feb 2026) · Xiaomi · 313 GB · 34.0점K2 Think V2K2 Think V2 · MBZUAI Institute of Foundation Models · 290 GB · 17.4점Mixtral 8x22B InstructMixtral 8x22B Instruct · Mistral · 281 GB · 4.0점Qwen3.5 122B A10BQwen3.5 122B A10B · Alibaba · 250 GB · 32.8점Pixtral LargePixtral Large · Mistral · 248 GB · 8.0점Nemotron 3 Super 120B A12BNemotron 3 Super 120B A12B · NVIDIA · 247 GB · 25.7점Mistral Large 2 (Nov '24)Mistral Large 2 (Nov '24) · Mistral · 245 GB · 9.0점MiniMax-M2.5MiniMax-M2.5 · MiniMax · 230 GB · 34.5점MiniMax-M2.7MiniMax-M2.7 · MiniMax · 230 GB · 38.9점MiniMax-M2MiniMax-M2 · MiniMax · 230 GB · 28.9점Qwen1.5 Chat 110BQwen1.5 Chat 110B · Alibaba · 222 GB · 3.7점Command ACommand A · Cohere · 222 GB · 7.5점GLM-4.5-AirGLM-4.5-Air · Z AI · 221 GB · 16.7점Llama 4 ScoutLlama 4 Scout · Meta · 217 GB · 10.3점GLM-4.5VGLM-4.5V · Z AI · 215 GB · 9.0점GLM-4.6VGLM-4.6V · Z AI · 215 GB · 16.9점Ling 2.6 FlashLing 2.6 Flash · InclusionAI · 215 GB · 14.2점INTELLECT-3INTELLECT-3 · Prime Intellect · 214 GB · 15.7점Command-R+ (Apr '24)Command-R+ (Apr '24) · Cohere · 208 GB · 2.6점Ring-flash-2.0Ring-flash-2.0 · InclusionAI · 206 GB · 8.0점Ling-flash-2.0Ling-flash-2.0 · InclusionAI · 206 GB · 9.6점Solar Open 100BSolar Open 100B · Upstage · 205 GB · 15.2점Llama 3.2 Instruct 90B (Vision)Llama 3.2 Instruct 90B (Vision) · Meta · 177 GB · 6.0점Qwen3 Next 80B A3B InstructQwen3 Next 80B A3B Instruct · Alibaba · 163 GB · 13.8점Qwen3 Next 80B A3BQwen3 Next 80B A3B · Alibaba · 163 GB · 16.9점DeepSeek V4 FlashDeepSeek V4 Flash · DeepSeek · 160 GB · 42.1점Qwen3 Coder NextQwen3 Coder Next · Alibaba · 159 GB · 21.3점Qwen2 Instruct 72BQwen2 Instruct 72B · Alibaba · 145 GB · 5.7점Qwen2.5 Instruct 72BQwen2.5 Instruct 72B · Alibaba · 145 GB · 9.4점Qwen Chat 72BQwen Chat 72B · Alibaba · 145 GB · 3.0점Apertus 70B InstructApertus 70B Instruct · Swiss AI Initiative · 141 GB · 2.0점Hermes 3 - Llama-3.1 70BHermes 3 - Llama-3.1 70B · Nous Research · 141 GB · 4.8점Hermes 4 - Llama-3.1 70BHermes 4 - Llama-3.1 70B · Nous Research · 141 GB · 9.9점Llama 3.1 Instruct 70BLlama 3.1 Instruct 70B · Meta · 141 GB · 6.5점DeepSeek R1 Distill Llama 70BDeepSeek R1 Distill Llama 70B · DeepSeek · 141 GB · 9.8점Llama 3.1 Nemotron Instruct 70BLlama 3.1 Nemotron Instruct 70B · NVIDIA · 141 GB · 7.4점Llama 3.3 Instruct 70BLlama 3.3 Instruct 70B · Meta · 141 GB · 9.3점LongCat Flash LiteLongCat Flash Lite · LongCat · 138 GB · 17.4점Llama 2 Chat 70BLlama 2 Chat 70B · Meta · 138 GB · 2.6점Mistral Medium 3.5Mistral Medium 3.5 · Mistral · 134 GB · 30.4점Llama 65BLlama 65B · Meta · 131 GB · 1.7점Sarvam 30BSarvam 30B · Sarvam · 129 GB · 6.4점Devstral 2Devstral 2 · Mistral · 128 GB · 19.2점Mistral Small 4Mistral Small 4 · Mistral · 121 GB · 19.7점Jamba 1.5 MiniJamba 1.5 Mini · AI21 Labs · 103 GB · 2.3점Jamba 1.7 MiniJamba 1.7 Mini · AI21 Labs · 103 GB · 2.3점Jamba 1.6 MiniJamba 1.6 Mini · AI21 Labs · 103 GB · 2.1점Llama 3.3 Nemotron Super 49B v1Llama 3.3 Nemotron Super 49B v1 · NVIDIA · 100 GB · 12.2점Llama Nemotron Super 49B v1.5Llama Nemotron Super 49B v1.5 · NVIDIA · 100 GB · 12.4점Kimi Linear 48B A3B InstructKimi Linear 48B A3B Instruct · Kimi · 98 GB · 8.4점Mixtral 8x7B InstructMixtral 8x7B Instruct · Mistral · 93 GB · 2.0점Tri-21B-ThinkTri-21B-Think · Trillion Labs · 83 GB · 12.3점Tri-21B-think PreviewTri-21B-think Preview · Trillion Labs · 83 GB · 13.6점G9v3-39A5BG9v3-39A5B · AI9Stars · 78 GB · 34.0점Seed-OSS-36B-InstructSeed-OSS-36B-Instruct · ByteDance Seed · 72 GB · 18.5점Qwen3.5 35B A3BQwen3.5 35B A3B · Alibaba · 72 GB · 29.9점Qwen3.6 35B A3BQwen3.6 35B A3B · Alibaba · 72 GB · 32.1점Qwen3 Omni 30B A3B InstructQwen3 Omni 30B A3B Instruct · Alibaba · 70 GB · 4.8점Command-R (Mar '24)Command-R (Mar '24) · Cohere · 70 GB · 1.7점EXAONE 4.5 33BEXAONE 4.5 33B · LG AI Research · 69 GB · 20.5점Qwen3 VL 32B InstructQwen3 VL 32B Instruct · Alibaba · 67 GB · 11.0점Qwen3 VL 32BQwen3 VL 32B · Alibaba · 67 GB · 18.1점HyperCLOVA X SEED Think (32B)HyperCLOVA X SEED Think (32B) · Naver · 67 GB · 17.2점Nemotron 3 Nano Omni 30B A3B ReasoningNemotron 3 Nano Omni 30B A3B Reasoning · NVIDIA · 66 GB · 15.0점Qwen2.5 Coder Instruct 32BQwen2.5 Coder Instruct 32B · Alibaba · 66 GB · 6.9점Qwen2.5 Instruct 32BQwen2.5 Instruct 32B · Alibaba · 66 GB · 7.2점QwQ 32B-PreviewQwQ 32B-Preview · Alibaba · 66 GB · 9.1점Qwen3 32BQwen3 32B · Alibaba · 66 GB · 11.4점QwQ 32BQwQ 32B · Alibaba · 66 GB · 13.4점DeepSeek R1 Distill Qwen 32BDeepSeek R1 Distill Qwen 32B · DeepSeek · 66 GB · 11.0점gpt-oss-120bgpt-oss-120b · OpenAI · 65 GB · 24.1점Olmo 3.1 32B ThinkOlmo 3.1 32B Think · Allen Institute for AI · 64 GB · 7.9점OLMo 2 32BOLMo 2 32B · Allen Institute for AI · 64 GB · 4.7점Olmo 3.1 32B InstructOlmo 3.1 32B Instruct · Allen Institute for AI · 64 GB · 6.2점Olmo 3 32B ThinkOlmo 3 32B Think · Allen Institute for AI · 64 GB · 6.1점Granite 4.0 H SmallGranite 4.0 H Small · IBM · 64 GB · 4.9점EXAONE 4.0 32BEXAONE 4.0 32B · LG AI Research · 64 GB · 10.5점Qwen3 Omni 30B A3BQwen3 Omni 30B A3B · Alibaba · 63 GB · 9.5점NVIDIA Nemotron 3 Nano 30B A3BNVIDIA Nemotron 3 Nano 30B A3B · NVIDIA · 63 GB · 14.5점Nemotron Cascade 2 30B A3BNemotron Cascade 2 30B A3B · NVIDIA · 63 GB · 17.8점Gemma 4 31BGemma 4 31B · Google · 62 GB · 29.7점Gemma 4 31B (Non-reasoning)Gemma 4 31B (Non-reasoning) · Google · 62 GB · 22.3점GLM-4.7-FlashGLM-4.7-Flash · Z AI · 62 GB · 23.3점Qwen3 VL 30B A3B InstructQwen3 VL 30B A3B Instruct · Alibaba · 62 GB · 9.9점Qwen3 VL 30B A3BQwen3 VL 30B A3B · Alibaba · 62 GB · 13.4점Qwen3 30B A3BQwen3 30B A3B · Alibaba · 61 GB · 9.2점Qwen3 30B A3B 2507Qwen3 30B A3B 2507 · Alibaba · 61 GB · 14.6점Qwen3 30B A3B 2507 InstructQwen3 30B A3B 2507 Instruct · Alibaba · 61 GB · 8.9점Qwen3 Coder 30B A3B InstructQwen3 Coder 30B A3B Instruct · Alibaba · 61 GB · 13.6점North Mini CodeNorth Mini Code · Cohere · 61 GB · 20.2점Muse GlimmerMuse Glimmer · Meta · 60 GB · 35.1점Granite 4.1 30BGranite 4.1 30B · IBM · 58 GB · 8.7점Qwen3.5 27BQwen3.5 27B · Alibaba · 56 GB · 34.6점Qwen3.6 27BQwen3.6 27B · Alibaba · 56 GB · 37.7점Gemma 3 27B InstructGemma 3 27B Instruct · Google · 55 GB · 7.4점Gemma 4 26B A4BGemma 4 26B A4B · Google · 52 GB · 26.1점DiffusionGemma 26B A4BDiffusionGemma 26B A4B · Google · 52 GB · 13.5점Mistral Small 3.1Mistral Small 3.1 · Mistral · 48 GB · 14.9점Mistral Small 3.2Mistral Small 3.2 · Mistral · 48 GB · 10.7점Magistral Small 1.2Magistral Small 1.2 · Mistral · 48 GB · 11.5점LFM2 24B A2BLFM2 24B A2B · Liquid AI · 48 GB · 4.6점Magistral Small 1Magistral Small 1 · Mistral · 47 GB · 10.6점Sarvam MSarvam M · Sarvam · 47 GB · 2.6점Devstral Small (Jul '25)Devstral Small (Jul '25) · Mistral · 47 GB · 9.1점DeepHermes 3 - Mistral 24B Preview (Non-reasoning)DeepHermes 3 - Mistral 24B Preview (Non-reasoning) · Nous Research · 47 GB · 5.0점Devstral Small (May '25)Devstral Small (May '25) · Mistral · 47 GB · 11.8점Mistral Small 3Mistral Small 3 · Mistral · 47 GB · 6.7점Mistral Small (Sep '24)Mistral Small (Sep '24) · Mistral · 44 GB · 4.3점Reka Flash 3Reka Flash 3 · Reka AI · 42 GB · 3.7점Molmo2-8BMolmo2-8B · Allen Institute for AI · 35 GB · 1.6점HyperNova 60B 2605HyperNova 60B 2605 · Multiverse Computing · 34 GB · 18.3점Ling-mini-2.0Ling-mini-2.0 · InclusionAI · 32 GB · 3.4점Molmo 7B-DMolmo 7B-D · Allen Institute for AI · 32 GB · 3.4점DeepSeek Coder V2 Lite InstructDeepSeek Coder V2 Lite Instruct · DeepSeek · 31 GB · 2.7점Apriel-v1.6-15B-ThinkerApriel-v1.6-15B-Thinker · ServiceNow · 30 GB · 20.8점Apriel-v1.5-15B-ThinkerApriel-v1.5-15B-Thinker · ServiceNow · 30 GB · 21.6점Qwen3 14BQwen3 14B · Alibaba · 30 GB · 10.4점DeepSeek R1 Distill Qwen 14BDeepSeek R1 Distill Qwen 14B · DeepSeek · 30 GB · 9.7점Phi-4Phi-4 · Microsoft · 29 GB · 4.6점Qwen Chat 14BQwen Chat 14B · Alibaba · 28 GB · 1.7점NVIDIA Nemotron Nano 12B v2 VLNVIDIA Nemotron Nano 12B v2 VL · NVIDIA · 26 GB · 8.8점Llama 2 Chat 13BLlama 2 Chat 13B · Meta · 26 GB · 2.6점Devstral Small 2Devstral Small 2 · Mistral · 26 GB · 17.7점Gemma 3 12B InstructGemma 3 12B Instruct · Google · 24 GB · 5.5점Gemma 4 12B (Non-reasoning)Gemma 4 12B (Non-reasoning) · Google · 24 GB · 13.2점Solar MiniSolar Mini · Upstage · 22 GB · 6.0점Llama 3.2 Instruct 11B (Vision)Llama 3.2 Instruct 11B (Vision) · Meta · 21 GB · 3.0점Step3 VL 10BStep3 VL 10B · StepFun · 20 GB · 9.3점Qwen3.5 9BQwen3.5 9B · Alibaba · 19 GB · 21.8점NVIDIA Nemotron Nano 9B V2NVIDIA Nemotron Nano 9B V2 · NVIDIA · 18 GB · 8.7점Granite 4.1 8BGranite 4.1 8B · IBM · 18 GB · 6.4점Qwen3 VL 8B InstructQwen3 VL 8B Instruct · Alibaba · 18 GB · 8.2점Qwen3 VL 8BQwen3 VL 8B · Alibaba · 18 GB · 10.5점LFM2.5-8B-A1BLFM2.5-8B-A1B · Liquid AI · 17 GB · 8.1점LFM2 8B A1BLFM2 8B A1B · Liquid AI · 17 GB · 1.3점DeepSeek R1 0528 Qwen3 8BDeepSeek R1 0528 Qwen3 8B · DeepSeek · 16 GB · 10.3점Qwen3 8BQwen3 8B · Alibaba · 16 GB · 8.3점Granite 3.3 8B (Non-reasoning)Granite 3.3 8B (Non-reasoning) · IBM · 16 GB · 1.3점DeepSeek R1 Distill Llama 8BDeepSeek R1 Distill Llama 8B · DeepSeek · 16 GB · 6.2점Llama 3.1 Instruct 8BLlama 3.1 Instruct 8B · Meta · 16 GB · 7.4점Llama 3 Instruct 70BLlama 3 Instruct 70B · Meta · 16 GB · 3.1점Apertus 8B InstructApertus 8B Instruct · Swiss AI Initiative · 16 GB · 1점DeepHermes 3 - Llama-3.1 8B Preview (Non-reasoning)DeepHermes 3 - Llama-3.1 8B Preview (Non-reasoning) · Nous Research · 16 GB · 1.9점Gemma 4 E4BGemma 4 E4B · Google · 16 GB · 12.2점Ministral 3 14BMinistral 3 14B · Mistral · 16 GB · 11.2점Gemma 3n E4B InstructGemma 3n E4B Instruct · Google · 16 GB · 1점Falcon-H1R-7BFalcon-H1R-7B · TII UAE · 15 GB · 9.7점Qwen2.5 Coder Instruct 7B Qwen2.5 Coder Instruct 7B · Alibaba · 15 GB · 4.1점Olmo 3 7B ThinkOlmo 3 7B Think · Allen Institute for AI · 15 GB · 3.6점Olmo 3 7B InstructOlmo 3 7B Instruct · Allen Institute for AI · 15 GB · 2.4점OLMo 2 7BOLMo 2 7B · Allen Institute for AI · 15 GB · 3.5점Mistral 7B InstructMistral 7B Instruct · Mistral · 14 GB · 1.7점OpenChat 3.5 (1210)OpenChat 3.5 (1210) · OpenChat · 14 GB · 2.6점gpt-oss-20bgpt-oss-20b · OpenAI · 14 GB · 15.2점Llama 2 Chat 7BLlama 2 Chat 7B · Meta · 14 GB · 3.9점Phi-4 Multimodal InstructPhi-4 Multimodal Instruct · Microsoft · 11 GB · 4.2점Gemma 3n E2B InstructGemma 3n E2B Instruct · Google · 11 GB · 1점Ministral 3 8BMinistral 3 8B · Mistral · 10 GB · 9.0점Gemma 4 E2BGemma 4 E2B · Google · 10 GB · 9.5점Qwen3.5 4BQwen3.5 4B · Alibaba · 9 GB · 20.4점Ministral 3 3BMinistral 3 3B · Mistral · 9 GB · 7.1점Llama 3.1 Nemotron Nano 4B v1.1Llama 3.1 Nemotron Nano 4B v1.1 · NVIDIA · 9 GB · 8.4점Qwen3 VL 4B InstructQwen3 VL 4B Instruct · Alibaba · 9 GB · 3.7점Qwen3 VL 4BQwen3 VL 4B · Alibaba · 9 GB · 7.7점Qwen3 4BQwen3 4B · Alibaba · 8 GB · 8.2점Qwen3 4B 2507Qwen3 4B 2507 · Alibaba · 8 GB · 11.9점Qwen3 4B 2507 InstructQwen3 4B 2507 Instruct · Alibaba · 8 GB · 6.9점Nanbeige4.1-3BNanbeige4.1-3B · Nanbeige · 8 GB · 11.0점NVIDIA Nemotron 3 Nano 4BNVIDIA Nemotron 3 Nano 4B · NVIDIA · 8 GB · 8.6점Phi-4 Mini InstructPhi-4 Mini Instruct · Microsoft · 8 GB · 5.7점Phi-3 Mini Instruct 3.8BPhi-3 Mini Instruct 3.8B · Microsoft · 8 GB · 4.3점Granite 4.0 MicroGranite 4.0 Micro · IBM · 7 GB · 2.0점Granite 4.1 3BGranite 4.1 3B · IBM · 7 GB · 4.4점Tiny Aya GlobalTiny Aya Global · Cohere · 7 GB · 1점Llama 3.2 Instruct 3BLlama 3.2 Instruct 3B · Meta · 6 GB · 3.9점Jamba Reasoning 3BJamba Reasoning 3B · AI21 Labs · 6 GB · 3.8점G9v3-3BG9v3-3B · AI9Stars · 6 GB · 16.2점Ling 3.0 TinyLing 3.0 Tiny · InclusionAI · 6 GB · 24.5점LFM2.5-2.6BLFM2.5-2.6B · Liquid AI · 5 GB · 11.0점LFM2 2.6BLFM2 2.6B · Liquid AI · 5 GB · 2.3점Qwen3.5 2BQwen3.5 2B · Alibaba · 4 GB · 7.4점Qwen3 1.7BQwen3 1.7B · Alibaba · 4 GB · 2.2점DeepSeek R1 Distill Qwen 1.5BDeepSeek R1 Distill Qwen 1.5B · DeepSeek · 4 GB · 3.3점Granite 4.0 1BGranite 4.0 1B · IBM · 3 GB · 1.6점LFM2.5-VL-1.6BLFM2.5-VL-1.6B · Liquid AI · 3 GB · 1점Granite 4.0 H 1BGranite 4.0 H 1B · IBM · 3 GB · 2.2점MiniCPM-V 4.6 1.3BMiniCPM-V 4.6 1.3B · OpenBMB · 3 GB · 3.8점Exaone 4.0 1.2BExaone 4.0 1.2B · LG AI Research · 3 GB · 2.5점Llama 3.2 Instruct 1BLlama 3.2 Instruct 1B · Meta · 2 GB · 1점LFM2 1.2BLFM2 1.2B · Liquid AI · 2 GB · 1점LFM2.5-1.2B-InstructLFM2.5-1.2B-Instruct · Liquid AI · 2 GB · 2.3점LFM2.5-1.2B-ThinkingLFM2.5-1.2B-Thinking · Liquid AI · 2 GB · 2.3점MiniCPM5-1BMiniCPM5-1B · OpenBMB · 2 GB · 11.9점Gemma 3 1B InstructGemma 3 1B Instruct · Google · 2 GB · 1점Qwen3.5 0.8BQwen3.5 0.8B · Alibaba · 2 GB · 5.2점Qwen3 0.6B (Non-reasoning)Qwen3 0.6B (Non-reasoning) · Alibaba · 2 GB · 1점Granite 4.0 350MGranite 4.0 350M · IBM · 1 GB · 1점Granite 4.0 H 350MGranite 4.0 H 350M · IBM · 1 GB · 1점Gemma 3 270MGemma 3 270M · Google · 0 GB · 2.0점DeepSeek V4 Flash 0731DeepSeek V4 Flash 0731 · DeepSeek · 167 GB · 51.8점Qwen3.8 27BQwen3.8 27B · Alibaba · 56 GB · 52.0점
가로는 원본 체크포인트 용량(로그 눈금), 세로는 Artificial Analysis Intelligence Index v4.1.1 (2026-08-26).

Spark 2대 안에서 50점을 넘긴 자리는 이미 하나가 아니다. 그래프 왼쪽 위 칸에 점이 둘 있다. 7월 31일의 DS4F가 167GB이고, 2주 뒤인 8월 14일에 나온 Qwen3.8 27B가 56GB로 같은 52점을 냈다. 뒤엣것은 한 대에도 들어간다. 다만 성격은 다르다. DS4F는 토큰 하나에 13B만 읽는 전문가 혼합이라 크기에 비해 빠르고 문맥을 100만 토큰까지 받는 반면, Qwen3.8 27B는 27B를 매번 다 읽는 덴스 모델이고 문맥은 26만 토큰이다. 그래도 2대를 사야 할 이유 하나가 보름 만에 흔들린 것은 맞다. 이것이 이 판의 성질이다. 하드웨어는 그대로인데 그 위에 올릴 것이 계속 바뀐다.

그리고 이 그래프에 찍힌 점들의 출신이 한쪽으로 쏠려 있다. 오픈웨이트의 선두를 한 곳이 계속 쥐고 있던 것은 아니다. 2023년에는 메타의 Llama가 기준점이었고, 그해 말 프랑스 Mistral의 Mixtral이 그 구도에 처음 금을 냈고, 2024년 여름에는 메타가 Llama 3.1 405B로 다시 맨 위에 올라섰다. 그런데 2024년 말부터는 계속 중국이다. Artificial Analysis는 2025년 2분기 보고서에서 이미 중국이 오픈웨이트의 최전선을 이끈다고 적으면서 DeepSeek, MiniMax, Alibaba, Moonshot을 이름으로 들었다. 2026년 8월 현재 오픈웨이트 상위 네 개는 전부 중국 연구소 것이고, 열 개로 넓혀도 절반이 넘는다. 메타가 지금 내놓는 오픈웨이트는 35점이라 최상단 60점과 스물다섯 점 떨어져 있다. 집에 있는 장비가 무엇을 돌릴 수 있는지를 지금 상당 부분 중국 연구소들이 정하고 있다는 뜻이다.

정리하면 이렇다. 모델을 줄여 온 몇 년과 하드웨어가 메모리를 키워 온 몇 년이 한자리에서 만났고, 그 접점에서 "집에 있는 컴퓨터로 프런티어급을 돌린다"가 처음 성립했다.

2026년 쪽 물건

견주려면 2026년 쪽도 표로 놓아야 한다. DGX Spark는 NVIDIA가 파는 책상 위 크기의 박스이고, ASUS의 GX10처럼 같은 칩을 쓴 제조사 판도 있다.

항목 Wiglaf (1995) DGX Spark 한 대 (2026)
프로세서 Intel 486 DX4, 100 MHz GB10 (Grace Blackwell)
메모리 노드당 16 MB 128 GB 통합 메모리
메모리 대역폭 명시 없음 273 GB/s
노드 사이 연결 10 Mbps 이더넷 두 망 ConnectX-7 200 Gb/s
16대 묶어 약 4만 달러 대당 4,000 달러 안팎

물가를 맞춰야 비교가 된다. 1995년의 1달러는 지금 2.19달러다.

1995년 값 지금 돈으로
Wiglaf 노드 한 대 2,500 달러 약 5,500 달러
Wiglaf 16대 전체 40,000 달러 약 87,700 달러

노드 한 대 값은 지금이 오히려 싸다. 1995년 486 한 대가 지금 돈으로 5,500달러쯤인데 DGX Spark는 4,000달러다. 클러스터 전체로 가면 격차가 확 벌어진다. 베오울프는 16대를 갖추는 데 지금 돈으로 약 8만 8천 달러를 썼다.

그리고 사람들이 실제로 몇 대를 사는지는 이렇게 갈린다. 한 대로도 돌긴 한다. 모델을 압축해서 올리면 된다. 다만 여유 있게 쓰려면 2대를 묶고, 큰 모델을 제대로 돌리려는 사람은 4대에서 8대까지 간다. 2대까지는 케이블 한 줄로 직접 잇지만 그 위로는 스위치가 있어야 해서, MikroTik CRS504 같은 100G 스위치를 같이 산다. 1994년에 이더넷 허브를 사야 했던 것과 같다.

그래서 이 글에서 "값싸다"는 절대 가격이 아니라 그때 다른 선택지와 견줘서라는 뜻이다. 베오울프의 대안은 당시 훨씬 비싸던 병렬 워크스테이션이었고, 지금의 대안은 데이터센터 GPU 서버나 클라우드다. 다만 지금 쪽에는 그 비교를 숫자로 끝까지 따져 본 자료가 아직 없다.

벤더는 박스를 팔고, 돌아가게 만든 것은 사용자다

NVIDIA가 GB10 박스를 팔고, 거기에는 노드끼리 초당 200기가비트로 잇는 포트가 들어 있다. 그런데 그 박스 위에서 DeepSeek V4 Flash가 실제로 돌아가게 만드는 것들은 아래와 같다.

1994년에 채운 것 2026년에 채우는 것
운영체제 리눅스와 GNU 툴체인 리눅스 (DGX OS)
하드웨어를 쓰게 하는 코드 Becker의 이더넷 드라이버 다수 SM12x용 attention 커널. PR 53542, PR 53543
링크 묶기 채널 본딩 패치 패치한 NCCL, 스위치 없는 링 구성
분산 실행 PVM, 이후 MPICH와 LAM/MPI vLLM 포크 여러 갈래, antirez/ds4
모델과 압축 해당 없음 양자화(GGUF, EXL3, NVFP4), 따로 훈련한 드래프터
조립법 배포 HOWTO, 책, CD, 메일링 리스트 GitHub 레시피 저장소와 결과 공유 게시판

여기서 레시피라고 부르는 것은 이 판의 고유한 물건이다. 어떤 모델을 어떤 엔진의 어느 커밋에, 어떤 압축으로, 어떤 환경 변수와 함께 올려야 실제로 돌아가는지를 통째로 적어 둔 문서와 스크립트 묶음이다. 검증된 조합 하나가 저장소 하나로 돌아다닌다. 1994년의 "How to Build a Beowulf"와 하는 일이 같다.

왼쪽 칸은 앞 절에서 하나씩 확인한 것이고, 오른쪽 칸이 지금 벌어지는 일이다. 맨 아랫줄 두 칸이 이 글의 요지를 압축한다. 1994년에도 2026년에도 퍼지는 것은 기계가 아니라 조립법이다.

한 줄만 짝이 없다. "모델과 압축"은 1994년에 대응물이 없다. 그때는 풀 문제를 과학자가 자기 연구에서 들고 왔고, 지금은 남이 공개한 가중치가 밖에서 온다. 이 차이는 뒤에서 다시 다룬다.

아래 인용에 나오는 말 하나를 먼저 풀어 둔다. LLM 추론은 두 단계로 나뉜다. 질문과 지금까지의 대화를 한꺼번에 읽어 들이는 프리필, 그리고 답을 한 토큰씩 뽑아내는 디코드다. 사용자가 체감하는 "답이 시작되기까지 걸리는 시간"은 프리필이 정하고, "답이 흘러나오는 속도"는 디코드가 정한다.

레시피를 배포하는 Mia가 8월 21일에 쓴 한 문장이 그 사정을 그대로 보여 준다. 좋아요가 천 개 넘게 붙었다.

이게 다 가능한 건 NVFP4 KV 캐시를 네이티브로 지원하게 만들고, 업스트림 프리필 경로의 커널 버그를 고쳐서 돌아가기라도 하게 만든 덕분이다.

All this is possible thanks to native NVFP4 KV cache & fixing kernel bugs in the upstream prefill path to make it work at all.

@MiaAI_lab · 2026-08-21

마지막 대목이 핵심이다. 성능을 높인 게 아니라 아예 동작하게 만들려고 vLLM 본체(업스트림, 즉 모두가 내려받는 원본 저장소)의 커널 버그를 고쳤다는 뜻이다. 1993년에 Becker가 3Com 카드를 리눅스에서 쓸 수 있게 만든 일과 성격이 겹친다.

공식 배포판을 그대로 쓰면 조용히 틀린 답이 나온다는 경고가 반복된다.

그냥 받은 vLLM은 이 모델을 조용히 틀리게 처리한다. 저쪽 포크에 그 레시피를 얹어야 비로소 돌아간다.

stock vLLM silently gets this model wrong, their fork plus that recipe is what makes it runnable at all.

@ScottLeimroth · 2026-08-23

NVIDIA가 문서에 "테스트하지 않음"이라고 적어 둔 경로를 사용자가 대신 만들어 넣기도 한다.

마스크 적용 NVFP4 XQA와 스트림 분리. Spark 문서가 테스트 안 됐다고 적어 둔 SM12x 경로다. 이제 존재한다.

masked NVFP4 XQA + isolated stream. The SM12x route Spark lists as untested. Now it exists.

@seanhighness · 2026-08-24 · vLLM PR 53543

이 판이 굴러가는 속도를 보여 주는 숫자도 하나 있다.

9일 동안 107개 커밋. MiaAI_lab과 plotarmordev, 그리고 훌륭한 DGX Spark 커뮤니티가 만든 것이다. 레시피 전체가 공개돼 있다.

107 commits in nine days, from @MiaAI_lab, @plotarmordev and the amazing DGX Spark community. The whole recipe is open.

@jmurillocode · 2026-08-22

다만 그 조립법이 늘 통하는 것은 아니다. 같은 판에서 반대 증언도 나온다.

금요일 하루를 통째로, 일요일 반나절을, 오늘도 얼마간 NVFP4 레시피를 GB10에서 돌려 보는 데 썼다. 그렇게 빌드했더니 GB10이 메모리 부족으로 죽어서 아직 해결도 확인 못 했다.

I spent my entire Friday, half Sunday and some part of today trying to make the NVFP4 recipe work on a GB10. Solution still unverified as all that build made the GB10 go OOM (unified SMH).

@shashtikar · 2026-08-25

1994년에도 같았을 것이다. 조립법이 공개돼 있다는 말과 따라 하면 된다는 말은 다르다. 베오울프 메일링 리스트가 1999년에 월 600건을 넘긴 것도 그만큼 막히는 사람이 많았다는 뜻이다.

왜 벤더 커널이 안 돌아가는가

기술적인 이유가 분명하다. DGX Spark의 GB10은 Blackwell이지만 데이터센터용 Blackwell(SM100)이 아니라 SM12x다. 구조가 tcgen05/TMEM 계열보다 오히려 예전 Ampere식 mma.sync에 가깝다. 그래서 "Blackwell 지원"이라고 적힌 커널이 그대로 돌지 않고, FlashMLA나 FlashAttention은 SM12x 전용 커널을 새로 써야 한다. 이 점은 3월에 이미 지적됐다.

DGX Spark는 Blackwell이지만 SM100이 아니라 SM12x를 쓴다. 그래서 "Blackwell 대응"이라는 커널 상당수가 돌지 않는다. 구조가 데이터센터 Blackwell의 tcgen05/TMEM보다 Ampere식 mma.sync에 가까워서, FlashMLA와 FlashAttention은 SM12x 전용 커널이 새로 필요하다.

DGX Spark is Blackwell, but it uses SM12x, not SM100, so many "Blackwell-ready" kernels do not run. Its architecture is closer to Ampere-style mma.sync than datacenter Blackwell tcgen05/TMEM, so FlashMLA/FA need new SM12x-specific kernels.

@LovePlastic5 · 2026-03-25

예를 들어 vLLM은 GB10에서 따로 지정하지 않으면 FlashInfer의 sparse_mla_sm120 경로를 기본으로 고르는데, 이 커널이 GB10에서 대기 상태에 갇혀 동시 요청이 둘만 돼도 응답이 수십 초로 늘어진다. 내 구성에서 확인한 것이고, 검증된 커뮤니티 레시피는 환경 변수 하나로 Triton 구현으로 갈아타 이 문제를 피해 간다. 기본값이 깨져 있고 레시피가 그것을 우회하는 셈이다.

사 모으는 것은 완제품만이 아니다

여기까지가 장비와 그 위에 올리는 것의 이야기다. 한 걸음 물러나서 지금 시장에서 벌어지는 일을 보면, 개인이 컴퓨팅 자원을 늘리는 방식은 하나가 아니다. 512GB짜리 맥 스튜디오를 2대, 4대씩 놓는 사람이 있고, DGX Spark를 2대에서 8대까지 늘리는 사람이 있고, 통합 메모리 대신 램이 적은 그래픽카드를 여러 장 모아 붙이는 사람이 있다. 방법은 달라도 사는 이유는 같다. 메모리를 늘리려는 것이다.

그 기준이 얼마나 노골적인지를 보여 준 일이 8월에 있었다. NVIDIA가 2021년에 채굴 전용으로 판 CMP 170HX라는 카드가 있다. 데이터센터용 A100과 같은 GA100 실리콘에 HBM2e를 얹었는데, 펌웨어로 3D 기능을 막고 메모리를 8GB나 10GB로 잘라 놓은 물건이다. 채굴이 끝난 뒤 이 카드들은 100달러에서 200달러에 굴러다녔다.

그런데 CMPUnlocker라는 도구가 잘라 둔 HBM2e를 되살릴 수 있다는 것이 알려졌다. 8GB짜리에서 최대 64GB, 10GB짜리에서 최대 80GB가 나온다. 값이 1,000달러를 넘겼다. 이베이 시세는 1,200달러에서 2,000달러까지 붙었다. 몇 주 만에 열 배다.

성능이 좋아진 것이 아니다. PCIe는 여전히 Gen2 x4로 묶여 있고 FP8도 FP4도 못 쓴다. 잘라 둔 메모리 뭉치는 애초에 품질 기준을 못 넘겨서 꺼 둔 것일 수 있어서 64GB가 안정적으로 잡힌다는 보장도 없다. 8GB짜리(하이닉스)는 그럭저럭 도는데 10GB짜리(삼성)는 80GB에서 불안정하다는 보고가 갈린다. 그런데도 열 배가 붙었다. 올릴 수 있는 용량이 여덟 배로 늘었다는 것 하나 때문이다.

CMP 170HX NVIDIA GPU가 64GB로 인식됐다. "이게 다들 하고 있다는 로컬 LLM인가?" 싶어 하면서, 중국에서 도착한 먼지투성이 GPU를 분해해 청소했다. 아직 팬이 안 와서 부하 운전은 못 해 봤다.

CMP 170HX NVIDIA GPUが64GBで認識された。「これがみんながやってるローカルLLM?」と疑問を持ちながら中国から届いた埃まみれのGPUを分解清掃。まだファンが届いてないので負荷運転はできてない。

@toyoshi · 2026-08-08

1994년에 사람들이 산 것도 결국 같은 것이었다. 486 한 대가 빨라서 산 것이 아니라 열여섯 대를 합쳐야 격자가 들어갔기 때문에 샀다.

그런데 이건 급한 일도, 중요한 일도 아니다

자체 구축이 필요한 회사는 이렇게 하지 않는다. 예산을 잡고 제대로 된 인프라를 산다. 여기서 말하는 것은 책상 위에 기계 몇 대를 놓고 레시피를 좇는 쪽이고, 그쪽을 사업의 눈으로 보면 급하지도 중요하지도 않다.

긴급도와 중요도 사분면 그림. 로컬 LLM이 둘 다 낮은 왼쪽 아래에 찍혀 있다.

기계를 사는 것이 끝이 아니라 거기서부터 시작이다. 검증됐다는 레시피를 그대로 따라 해도 사흘을 태우고 메모리 부족으로 죽는다. 프로덕션에 올릴 것과 토큰 값을 비교하고 있을 때가 아니라 일단 돌아가게 만드는 것이 일이다. 회사 일에 확실히 되는 것을 써야 한다면 지금은 사서 쓰는 편이 맞다.

그런데 벤더가 비워 둔 자리를 메우는 속도는 빨랐다. 앞에서 본 것들이 그 기록이다. NVIDIA가 문서에 테스트하지 않았다고 적어 둔 경로를 사용자가 만들어 넣었고, 레시피 저장소에는 9일 만에 백 개 넘는 커밋이 쌓였고, 모델이 공개된 그날 이미 2대를 묶어 돌린 사람이 있었다.

왜 이쪽이 빠른지는 이 글이 답하지 못한다. 컨슈머 장비가 업계의 본류가 아니라서 아무도 정리해 주지 않고 그래서 오히려 손이 빨리 붙는다고 읽을 수는 있지만, 본류 쪽 속도와 견줘 본 것이 아니다. vLLM에 구멍이 많은 것도 개인 규모로 쓰라고 만든 물건이 아니어서라고 보는 편이 자연스럽지만 그 연결도 증명한 것은 아니다. 확실한 것은 하나다. 구멍이 있었고, 메운 쪽은 사용자였다.

1994년도 같았다. 486 열여섯 대를 묶는 일은 그때 컴퓨터 업계의 급한 일도 중요한 일도 아니었다. 3Com이 리눅스 드라이버를 내놓는 데 여섯 해가 걸린 것이 그 증거다. 그 여섯 해 동안 판을 만든 것은 메일링 리스트였다.

두 시대를 나란히 놓으면

1994 베오울프 2026 DGX Spark
하드웨어 Intel 486 DX4 16대, 시중 이더넷 NVIDIA GB10 2대에서 열여섯 대까지, ConnectX-7
벤더 의도 클러스터용으로 판 것이 아님 2대 직결은 공식 문서로 안내, 그 이상은 스위치를 전제
링크 묶기 채널 본딩 패치 NCCL 패치, 스위치 없는 링 구성
통신 라이브러리 PVM, 나중에 MPI NCCL
벤더가 안 준 것 랜카드 드라이버 SM12x 커널
역할 분리 관리 노드와 계산 노드 관리용 컴퓨터와 추론 노드
퍼뜨린 방식 HOWTO, 책, CD, 메일링 리스트 GitHub 레시피, X
어떤 일을 시키나 배치 (과학 계산, 시뮬레이션) 상시 서비스 (에이전트)
사용자가 만든 최상층 시스템 소프트웨어 모델 가중치까지 (양자화, 드래프터)

세 가지 차이가 특히 중요하다.

첫째, 이번에는 벤더가 인터커넥트를 넣어서 판다. 1994년에는 랜카드를 두 장 꽂자는 발상부터가 사용자 몫이었다. 지금은 두 회사가 각자 그 자리를 채워 놓았다.

NVIDIA는 ConnectX-7 200Gb/s를 박스에 넣고 2대 직결 방법을 문서로 제공한다. 그 결과를 한 사용자가 이렇게 정리했다.

DGX Spark의 장점은 ConnectX-7이라고 생각한다. 여러 대가 돼도 그럭저럭 빠르다. 성능이 모자라면 한 대 더 사면 된다는 단순한 운용이 가능해지는 것.

DGX Sparkの良さはConnect-X 7だと思う。複数台になってもそこそこ早い。性能が足りなくなったらもう一台買えばいい、と言うシンプルな運用にできること。

@kuninori · 2026-08-23

애플은 한술 더 떠서 여러 대를 묶는 것을 판매 문구에 적었다. 2026년 8월 Mac Studio 발표문에 이런 문장이 있다.

사용자와 팀은 내장된 썬더볼트 5와 RDMA 지원을 이용해 여러 대의 Mac Studio를 클러스터로 묶을 수 있습니다. 이렇게 하면 거대한 공유 메모리 풀이 만들어집니다. 네 대를 묶은 클러스터는 한 대일 때보다 최대 세 배 빠른 AI 추론을 제공합니다.

제품 페이지는 한 걸음 더 나가서 클러스터링 도구로 특정 오픈소스 프로젝트(exo)를 이름까지 적어 안내한다. 1994년에 벤더가 "우리 카드 두 장을 묶어 쓰세요"라고 말한 적은 없다.

다만 공식이 안내하는 범위는 거기까지다. 스위치를 건너뛰고 네 대를 링으로 잇는 구성도, 세 대를 그물처럼 묶는 구성도, 밀려난 문맥을 디스크에 내렸다 되살리는 것도 전부 사용자들이 알아서 하고 있다.

둘째, 사용자가 만드는 층이 한 칸 더 깊어졌다. 1994년에는 풀어야 할 문제를 과학자가 자기 연구에서 들고 왔지만 지금은 남이 공개한 가중치가 밖에서 온다. 그런데 사용자들은 그것을 받아만 쓰지 않는다. 공개된 가중치를 양자화하고, 전문가를 쳐내고, 보조 모델을 따로 훈련해 붙인다. 베오울프에서 사용자의 몫이 시스템 소프트웨어까지였다면 지금은 커널부터 모델 가중치까지다. 벤더가 준 것은 박스뿐이다.

셋째, 시키는 일의 성격이 바뀌었고 이것이 구매 단위를 정한다. 베오울프 시절 작업은 밤에 던져 놓고 아침에 찾는 배치였다. 노드를 더 꽂으면 같은 작업이 그만큼 빨라졌다. 지금은 모델이 메모리에 상주하고 에이전트가 하루 종일 붙어 있어서, 작업 하나가 클러스터 하나를 통째로 차지한다.

그래서 초당 몇 토큰이라는 숫자는 이 판에서 별 뜻이 없다. 실제로 원하는 것은 50만 토큰짜리 세션 대여섯 개를 메모리에 올려 둔 채로 쓰는 것이고, 그 상태에서는 프리필과 디코드가 쉬지 않고 겹쳐서 벤치마크에서 본 속도가 나오지 않는다. 적어 놓고도 이상한 것이, 상용 서비스가 20만 토큰 문맥을 넘어선 지 1년이 안 됐고 1년 반 전에는 10만만 넘어가도 비싸고 느려서 제대로 못 썼다.

그래서 같은 판에서 "한 대는 그냥 장식이고 두 대는 돼야 제 몫을 한다"(@jmbollenbacher, 8월 23일)는 말이 나오고, 1대 구성은 메모리 부족을 못 피해 전용 포크가 필요한데 2대면 공식 모델로도 안정적이라는 보고(@blauerberg, 8월 21일)가 따른다. 그리고 대수를 늘려도 작업을 하나 더 돌리려면 클러스터가 통째로 하나 더 있어야 한다. 1대, 2대, 4대에서 8대로 올라가는 계단이 여기서 나온다.

앞으로 어떻게 될까

지금은 레시피가 있어야 겨우 도는 상태다. 이건 오래 가지 않을 것이다. 9일 만에 백 개 넘는 커밋이 쌓이는 속도라면 커널의 구멍은 메워지고, "어느 커밋에 어떤 플래그"라는 지식은 값어치를 잃는다. 그 자리를 사면 바로 도는 제품이 채운다. 지금 사람들이 손으로 하는 일의 대부분은 몇 달 뒤 설치 프로그램 안으로 들어갈 것이다.

모델은 계속 작아지고 똑똑해진다. 다만 그 둘이 같은 속도로 오지는 않는다. 오픈과 클로즈드의 점수 차는 계속 좁아졌다. 같은 지수 버전 안에서 견주면 2023년 말 열몇 점, 2024년 중반 예닐곱 점, 2025년 다섯에서 열 점 사이였고 지금은 세 점이다. 지수 구성이 여러 차례 바뀌어서 해가 다른 점수를 그대로 빼면 안 되지만, 방향은 분명하다. 그러니 지금 52점인 가정 프런티어도 오를 것이다. 문제는 크기다. 점수가 오르면서 덩치도 같이 커지면 집에는 못 들어온다. 8월의 V4 Pro가 그랬다. 893GB짜리는 점수가 아무리 높아도 2대짜리 구성과는 상관없는 물건이다. 앞으로 볼 것은 점수가 아니라 점수와 크기의 조합이고, 그 조합이 좋은 모델이 나오는 날마다 이미 팔린 장비들의 값어치가 다시 매겨진다.

파는 쪽도 가만있지 않는다. 값싼 소형 모델을 거의 원가로 풀어 기저 수요를 되찾을 수도 있고, 요금제를 포함량과 초과 종량으로 더 정교하게 다듬을 수도 있고, 지능을 폰과 노트북에 직접 넣을 수도 있다. 다만 마지막 길에는 물리적인 벽이 있다. 폰의 메모리는 십수 GB에서 멈춰 있고, AI 데이터센터가 메모리 생산을 빨아들이는 동안 소비자 기기의 증설은 오히려 어려워졌다. 압축이 지금까지 줄여 낸 폭도 몇 배 수준이다. 그래서 폰이 이 장비들을 대체하기보다 폰에는 보조 지능, 책상 위에는 본체 지능으로 갈릴 가능성이 높다. 역설적이지만 메모리가 비싸질수록 통합 메모리가 큰 컴퓨터는 메모리를 소유하는 가장 싼 방법으로 남는다.

이 계보에는 1994년에 없던 약점이 하나 있다. 그때는 부품을 시중에서 사고 소프트웨어가 공개돼 있어서 밖에서 무엇이 끊겨도 하던 일이 멈추지 않았다. 지금은 다르다. 이 판 전체가 누군가 계속 가중치를 공개해 준다는 전제 위에 서 있다. 모델을 만드는 쪽이 공개를 멈추면 그 장비는 그날로 어제 받아 둔 것만 돌리는 물건이 된다. 커널을 고치고 양자화를 개선하는 노동도 올릴 것이 없으면 갈 곳이 없다. 지금까지는 공개가 이어졌고 오히려 빨라졌지만, 그것이 계속되리라는 보장은 이 판 안에 없다. 게다가 앞에서 본 대로 그 "누군가"는 몇 곳 되지 않는다.

대체가 아니라 병행이 이어질 것이다. 1994년에도 그랬다. Becker는 나중에 한 줄로 정리한다. "클러스터는 슈퍼컴퓨터를 보완하는 것이었다." 지금 여러 대를 굴리는 사람들도 구독을 끊지 않았다. 판정과 어려운 문제는 상용에 보내고, 분량이 많거나 문맥이 길거나 반복되는 일은 집으로 보낸다. 이 배분은 점수 차가 0이 되는 날 한꺼번에 뒤집히는 것이 아니라, 작업마다 품질 문턱을 넘을 때 조금씩 옮겨간다. 이미 그렇게 옮겨가고 있다.

무엇을 묶어서 무엇을 얻는가

처음 이야기로 돌아가자. 개인이 컴퓨터를 여러 대 묶은 일은 드물었고, 두 번 다 이유는 같았다. 담을 자리가 모자랐다. 1994년 Wiglaf는 노드당 램이 16 MB였다. 그보다 큰 격자는 한 대에 올라가지 않는다. 열여섯 대를 묶어 256 MB를 만들어야 비로소 들어간다. 논문이 앞세운 목표는 1 Gops라는 속도였지만, 열여섯이라는 대수를 정한 것은 메모리였다. 지금도 같다. 가중치가 한 대의 메모리를 넘으면 기다린다고 되지 않는다.

다만 지금은 빠져나갈 구멍이 하나 있다. 정밀도를 낮추면 한 대에도 얹힌다. 그때는 품질을 어디까지 버렸는지가 다시 문제가 되고, 그래서 사람들은 원본을 올리려고 컴퓨터를 한 대 더 산다. 노드를 더해서 기계가 똑똑해지는 것이 아니라 더 큰 것을 올릴 수 있게 되는 것이다.

(그 사이에 암호화폐 채굴이 있었지만 저것은 다른 종류다. 가르는 것은 한 대로 하는 일과 성질이 같으냐다. 채굴은 한 대로도 똑같은 일을 한다. 수익이 몇 분의 일일 뿐이고 노드는 양을 늘릴 뿐이다. 반면 1994년의 격자도 지금의 원본 가중치도 한 대에는 아예 올라가지 않아 다른 일이 된다.)

그리고 그렇게 올린 것의 성격이 다르다. 계산은 답이 나오면 끝나는데, 모델은 켜 둔 채로 쓴다. 하루 종일 붙어서 코드를 읽고 파일을 고치고 다음에 할 일을 정한다. 그래서 이번에 묶은 컴퓨터는 일이 끝나도 꺼지지 않는다. 집에 늘 켜져 있는 물건이 됐다. 1994년에는 없던 성질이다.

여기서 빌리는 것과 소유하는 것의 차이가 갈린다. 쿼터 걱정 없이 쓴다는 말은 단순히 싸다는 뜻이 아니다. 아껴 쓰던 도구를 마음껏 쓰기 시작하면 그 도구로 하는 일의 종류가 바뀐다. 한 번 물어보고 말 것을 스무 번 물어보게 되고, 사람이 하던 검토를 기계에 통째로 맡기게 된다. 지금 2대씩 사는 사람들이 실제로 사는 것은 성능 몇 점이 아니라 한도 없이 쓸 권리다.

게다가 이 물건은 사고 난 뒤에 좋아진다. 같은 장비에 더 나은 가중치가 올라가면 어제 산 것이 오늘 더 똑똑해진다. 판 사람이 손대지 않아도 그렇게 된다. 값이 떨어지기만 하던 소비자 기기에서 흔한 일이 아니다.

묶어야 넘을 수 있는 문턱이 또 한 번 생겼고, 이번에 그 너머에 있는 것은 하루 종일 켜 두고 쓰는 무언가다. 답이 나오면 끝나는 계산이 아니다. 게다가 그것은 빌리지 않고 소유되며 시간이 지나면 좋아진다. 사람들이 2대에서 4대로, 8대로 늘리는 이유도 결국 거기에 있다.

베오울프가 만든 것은 결국 두 가지였다. 시중에서 살 수 있는 부품으로 조립하는 슈퍼컴퓨터, 그리고 여럿이 나눠 쓰는 것이 아니라 한 사람이 통째로 쓰는 슈퍼컴퓨터다. 2026년에 책상 위에 기계를 몇 대씩 쌓는 사람들이 만들고 있는 것도 같은 둘이다.

그리고 그 문턱을 넘는 길은 두 번 다 열려 있었다. 1994년에는 HOWTO와 책과 CD였고 지금은 저장소와 레시피다. 기관이 먼저 길을 냈고, 그 길을 막아 두지 않았기 때문에 개인이 걸어 들어왔다. 그때도 그랬고 지금도 그렇다.

참고한 자료와 조사의 한계

1994 베오울프

논문은 두 편이다. 시스템 소개와 성능 분석이 갈라져 있다.

자료 무엇이 실려 있나
Sterling, Becker, Savarese, Dorband, Ranawake, Packer, "BEOWULF: A Parallel Workstation for Scientific Computation", ICPP 1995 (Duke 미러, USGS 보존 PDF) 16개 마더보드, DRAM 256 MB(보드당 16 MB), 보드당 하드디스크 1개, 이더넷 2개(10baseT 또는 10base2), 프로세서당 500 MB 디스크와 100 MHz Intel DX4, 모니터 2대와 키보드 1개. 저자 여섯 명. "single user multiple computer with direct access keyboard and monitors". 채널 본딩은 저자 한 명이 쓴 드라이버이고 "facilitated by the free access to Linux kernel source code". CFD 코드 단일 프로세서 4.5 MFLOPS, 16대 지속 60 MFLOPS, 같은 크기 Paragon 및 CM-5와 견줄 만하고, Cray T3D 는 더 빠르되 차이가 2.5배 미만. PVM 오버헤드는 256바이트 왕복이 소켓 10 ms 대 PVM 60 ms. N체 코드는 성간운 구조와 슈메이커-레비 9 혜성 파편화 모형에 쓰임
Sterling, Savarese, Becker, Fryxell, Olson, "Communication Overhead for Space Science Applications on the Beowulf Parallel Workstation", HPDC 1995 (Duke 미러) 시제품 전체 비용 약 4만 달러와 최고 성능 1 Gops, 포화 시 두 망이 한 망보다 70% 높은 지속 대역폭, 고정 크기 PPM에서 오버헤드 60% 초과인데 통신 루틴이 차지한 시간은 전체 실행 시간의 1%이고 원인은 시간 단계 끝 동기화, 8에서 16 프로세서로 늘려도 성능은 약 10%만 증가, 두 망을 써도 PPM 코드에는 효과가 무시할 만함
자료 무엇이 실려 있나
리눅스 본딩 드라이버 문서 (현행 렌더) "The bonding driver originally came from Donald Becker's beowulf patches for kernel 2.0." 그리고 extreme-linux 시절 도구는 더 이상 동작하지 않는다는 안내
FUNET에 보존된 1996-04-01 커널 패치(1.3.82) 3c509.c 헤더가 "Written 1993,1994"에서 "Written 1993-1995 by Donald Becker"로 바뀌는 diff, 버전 문자열의 [email protected]
현재 커널의 3c509.c 지금도 남아 있는 "Written 1993-2000 by Donald Becker"
Ethernet-HOWTO Becker를 이 문서의 1차 정보원으로 소개하며 "현재 리눅스에서 쓸 수 있는 이더넷 카드 드라이버를 많이 작성한 데 감사해야 할 사람"이라고 적음.
LWN, 1999-09-16 "For the first time, 3Com has actually provided its own Linux driver", GPL 배포, 3Com이 Becker의 공을 크게 인정한다는 서술
3Com의 원 발표 메일, 1999-09-14 수신처가 [email protected], "one of our first steps into the Linux world", Becker와 함께 작업해 3C59x 드라이버와 호환성을 확보했다는 문장
NASA HPCC 프로그램 보고서 TM-4653, CESDIS 1993~94 연차보고서 베오울프가 놓인 자리. 연방 HPCC → NASA HPCC → ESS(고다드 주관) → CESDIS. ESS 과학 요구가 테라플롭스급이라는 규정과 연도별 목표
James Fischer, ESS 프로젝트 회고 5만 달러 기가플롭스 워크스테이션 목표보다 앞선 문제가 소프트웨어 보존이었다는 서술. 업체별 시스템은 흔히 3년이 못 가 코드를 다시 이식해야 했다. 1996년 펜티엄 클러스터가 LANL 약 1.1기가플롭스(6만 달러 미만), Caltech과 JPL 약 1.26기가플롭스(약 5만 달러)로 목표를 넘김
TOP500 1994년 11월 당시 1위 Numerical Wind Tunnel 170기가플롭스. 1997년 테라플롭스 목표와의 거리
NCAR 슈퍼컴퓨팅 연혁, CM-5 1993년 4월 도입한 32노드 CM-5가 147만 달러, NCAR가 "$46,000 per node"라고 직접 기록. 노드는 SPARC 하나에 벡터 유닛 넷, peak 128 MFLOPS
NASA NAS, SC22 프로젝트 페이지 "NASA's investment in Beowulf was around four people per year for four years. Following that, Beowulf took on a life of its own, and the NASA team became a contributor to the project, rather than its coordinator."
NASA Spinoff, Beowulf Clusters Make Supercomputing Accessible (2020년판) NASA 공식 회고. 1994년 여름 최초 클러스터. 이름의 유래: 관리자가 즉석에서 이름을 요구하자 Sterling이 "에라 모르겠다, 그냥 베오울프라고 해. 어차피 아무도 모를 텐데"라고 답했고, 이후 10년간 두 사람이 말한 "강대한 상대에 맞선 약자"라는 설명은 나중에 지어낸 것이라고 Sterling이 인정. 고다드 ESS가 1997년까지 테라플롭스를 목표했으나 1993년 최고 코드가 수십 기가플롭스에 그침, 업체마다 서로 호환되지 않는 독점 하드웨어와 소프트웨어, 워크스테이션 한 대가 사용자당 5만 달러, 잦은 크래시로 재부팅에 30분
Red Hat, Announcing Extreme Linux 1998년 5월 13일 발표, "also known as The Beowulf Project", NASA 고다드와 20여 연구기관 협업, "$29.95 CD-ROM product"
Beowulf 메일링 리스트 아카이브(MARC) 월별 건수를 직접 셈. 1997-03 2건, 1997-09 4건, 1997-10 78건, 1999-05 624건, 1999-06 623건
Duke의 베오울프 자료 모음 CESDIS 원 사이트의 보존 미러. 1994년 여름 16노드 조립으로 프로젝트가 시작됐다는 서술

그 밖에 확인한 자료

자료 무엇이 실려 있나
미국 소비자물가지수 1995년 연평균 152.38, 2026년 7월 333.918. 배수 2.19
Artificial Analysis Intelligence Index 본문의 점수와 그래프의 세로축, 그리고 상위 열 개 중 아홉 개라는 비율이 모두 이 지수(v4.1.1, 2026-08-26 확인) 기준이다. 아홉 개 평가를 합친 값이라 점수 차가 곧 효용 차는 아니다. 지수 구성이 여러 차례 바뀌었으므로 연도가 다른 점수를 그대로 빼면 안 된다
Apple 뉴스룸, Mac Studio (2026-08) 썬더볼트 5와 RDMA로 여러 대를 묶는다는 서술, 네 대 클러스터가 한 대보다 최대 세 배라는 문장, 512GB 구성과 1.2TB/s 대역폭
Apple 기술노트 TN3205 썬더볼트 RDMA는 macOS 26.2부터, 썬더볼트 5를 갖춘 Apple silicon에서 지원
Digital Spaceport, 2,000달러 EPYC 조립기 (2025-01-29) EPYC 7702 64코어, 512GB DDR4-2400 ECC, GPU 없음. R1 671B Q4 약 400GB, 초당 3.5~4.25토큰
Notebookcheck, GPU 없이 671B 돌리기 (2025-02-04) 듀얼 EPYC에 DDR5 768GB, 약 6,000달러. Q8 가중치 700GB, 초당 6~8토큰
MacRumors, M3 Ultra가 R1을 돌리다 (2025-03-17) 맥 스튜디오 M3 Ultra 512GB에서 R1 671B 4비트 404GB, 초당 17~18토큰, 200W 미만
CMP 170HX 값 폭등 보도 (2026-08-07) 2021년 채굴 전용 출시, GA100 실리콘에 HBM2e, 펌웨어로 8GB/10GB 제한, CMPUnlocker로 64GB/80GB 해제, 100~200달러에서 1,000달러 초과로 급등, 이베이 1,200~2,000달러. 64GB 안정성 미보장, PCIe Gen2 x4, FP8/FP4 미지원, 하이닉스 8GB판이 삼성 10GB판보다 안정적
해제 도구 CMPUnlocker 펌웨어가 잠가 둔 SM 연산량과 HBM2e 구성을 되살리는 도구

2026 DGX Spark 담론

본문과 관련해 확인한 vLLM 패치 세 건이다.

PR 제목
41834 [New Model][Nvidia] Add SM12x support for DeepSeek V4 Flash
53542 [Perf][SpecDecode] Preserve active runtime-K width in GDN metadata
53543 [Bugfix][Perf][Attention] Enable masked NVFP4 XQA on SM120

본문에 인용한 것 외에 같은 갈래로 확인한 글들이다.

계정 날짜 요지 링크
@jmbollenbacher 08-23 1대는 문진이나 마찬가지, 2대는 돼야 값어치를 한다 원문
@voluntas 08-23 2대 유지보수를 "레시피가 갱신됐으니 최신으로" 한마디로 한다 원문
@0xWhiteMage 08-24 레시피 만들기가 정말 쉽지 않다, 시행착오의 연속 원문
@shashtikar 08-25 금요일 하루와 일요일 반나절을 NVFP4 레시피에 썼는데 아직 미해결 원문
@blauerberg 08-21 1대 구성은 OOM을 못 피해서 전용 포크가 필요, 2대는 공식 모델로도 안정적. 다만 다음 날 화제의 레시피 저장소는 문서와 스크립트가 마음에 안 들어 쓰지 않고, 컨텍스트를 256K에서 200K로 줄여 해결했다 원문
@zfields 08-24 Qwen3.8 레시피의 공개 수치를 1대에서 재현하지 못했다(DS4F가 아니다), 실사용 11 tok/s 원문
@alexellisuk 08-22 스위치 없는 클러스터용 SparkRing 도입 원문
@mr_r0b0t 06-28 전용 vLLM 포크로 출시 당일 듀얼 GB10에서 DSV4 구동 원문
@nacyotKim 08-19 DS4F 가동률이 한 자리 수준, 실제로는 M3 Ultra에서 돌고 있다 원문
@nacyotKim 08-24 KV 디스크 오프로딩을 붙인 실험용 vLLM 포크 공개 원문
Kieran Huggins, Ye Olde Beowulf (circa 2000) Flickr 원본 2007년 게시, CC BY 2.0. 대학 룸메이트들과 몇백 달러로 낡은 486 DX를 모아 지하실에 만든 클러스터. 2026년 6월 X에서 다른 캡션이 붙어 널리 돌았는데, 그 글은 차고라고 적었고 만든 사람이 자기라는 뜻으로 읽힌다. 사진의 출처와 원 설명은 위 링크다
@ArcadianComp 06-17 위 글 인용, llama.cpp RPC로 26년 뒤 같은 일을 한다는 답글 원문
@geerlingguy 2025-08-07 여러 대를 묶는 추론 도구 시험용 저장소 beowulf-ai-cluster 공개 원문
@toyoshi 08-08 중국에서 받은 CMP 170HX가 64GB로 인식됨 원문

조사의 한계

  • Wiglaf의 사양은 자료마다 조금씩 어긋난다. 총 디스크 용량과 노드당 랜카드 수가 다르게 적힌 곳이 있어 "1994년 최초 부품 목록"으로 읽으면 안 된다.
  • 그래프의 메모리 값은 잰 것이 아니라 총 파라미터에 배포 정밀도의 바이트 수를 곱한 계산값이다. 실제 체크포인트는 정밀도가 섞여 있어 이보다 크거나 작을 수 있고, KV 캐시와 실행 중 메모리는 아예 빼고 셌다. 같은 규칙을 모든 모델에 똑같이 적용했으니 절대값보다 서로 간의 거리를 보는 편이 맞다.
  • Intelligence Index 점수 가운데 일부는 Artificial Analysis가 독립 평가 예정이라고 표시한 추정치다. 특히 2023~2024년 모델의 낮은 점수는 당시 점수가 아니라 훨씬 어려워진 지금 문제로 다시 매긴 값이다.
  • 인용한 공개 글은 표본이지 전수가 아니다. 게다가 이런 판에서 목소리를 내는 쪽은 대개 성공한 사람이라, 조용히 포기한 경우는 잘 보이지 않는다.
  • 기본 attention 경로가 GB10에서 막히는 것과 FLASHMLA_SPARSE_DSV4로 바꾸면 웜업에서 크래시하는 것은 내 구성에서 본 것이다. 같은 증상을 적은 제3자 기록은 찾지 못했다.
  • 트윗의 한국어는 기계 번역을 다듬은 것이라 뉘앙스가 원문과 다를 수 있다. 원문을 함께 실은 이유다.