128K 컨텍스트 창의 진짜 병목 — Attention의 이차 복잡도와 그 너머

128K 토큰짜리 컨텍스트 창이 이제는 흔한 사양이 됐다. Claude, GPT-4o, Gemini 1.5는 이미 그 선을 넘었고, 일부 모델은 백만 토큰을 공언하기도 한다. 그런데 이 숫자들이 실제로 얼마나 잘 “작동”하는지는 별개의 이야기다. 컨텍스트 창 확장의 병목은 두 갈래다. 하나는 이미 많이 알려진 KV 캐시(Key-Value Cache) 메모리 비용이고, 다른 하나는 Attention 연산 자체의 계산 복잡도다. 전자는 얼마나 … 더 읽기

Speculative Decoding: 작은 모델이 큰 모델의 속도를 높이는 원리

거대 언어 모델(LLM)을 사용할 때 가장 답답한 순간은 무엇일까요? 아마도 텍스트가 한 글자씩 느릿하게 출력되는 ‘자기회귀적(Autoregressive) 생성’의 속도일 것입니다. 모델이 커질수록 이 문제는 더욱 심각해지며, 이는 실시간 대화형 AI 서비스의 가장 큰 기술적 장벽이 됩니다. 최근 이 문제를 해결하기 위해 등장한 Speculative Decoding(추측적 디코딩)은 매우 영리한 접근 방식을 취합니다. “작고 빠른 모델이 미리 예측하고, 큰 … 더 읽기

Anthropic, Claude Opus 4.8 공개

Anthropic, Claude Opus 4.8 공개

Anthropic이 2026년 5월 28일 Claude Opus 4.8을 공개했다. Opus 4.7이 나온 지 그리 오래되지 않은 시점이지만, 이번 릴리스는 단순한 마이너 패치로 보기 어렵다. 코드 결함 감지 능력이 이전 모델 대비 약 4배 향상됐고, Fast Mode 가격은 3배 가량 낮아졌으며, Effort Control이라는 새로운 제어 메커니즘이 API 수준에서 도입됐다. 이번 릴리스에서 가장 눈에 띄는 개념은 Effort Control이다. … 더 읽기

구글 Antigravity 2.0 CLI 완전 정복 — 설치부터 에이전트 실전 활용까지

구글 Antigravity 2.0 CLI 완전 정복 — 설치부터 에이전트 실전 활용까지

구글이 지난 5월 19일 Google IO 2026에서 공개한 안티그래비티(Antigravity) 2.0은 단순한 IDE 업그레이드가 아니다. 데스크톱 앱, CLI, SDK, 관리형 에이전트, 엔터프라이즈 플랫폼까지 다섯 가지 서피스(surface)를 한꺼번에 쏟아낸, 에이전트 중심 개발 생태계의 전면 재편 선언이다. 이미지 출처: Unsplash 이 글은 그 중에서도 CLI에 집중한다. agy라는 짧은 명령 하나로 터미널을 에이전트 런타임으로 바꿔주는 안티그래비티 CLI의 설치부터 실전 … 더 읽기

AI 코딩 벤치마크를 믿을 수 없는 이유 – DeepSWE가 드러낸 불편한 진실

AI 코딩 벤치마크를 믿을 수 없는 이유 – DeepSWE가 드러낸 불편한 진실

GPT-5.5가 1위, DeepSeek V4 Pro가 꼴찌에서 두 번째. 기존 SWE-Bench 리더보드에서 익숙하게 보던 순서와 전혀 다른 결과가 나왔다. Datacurve가 공개한 DeepSWE 벤치마크 이야기다. 순위 자체보다 더 흥미로운 건 이 벤치마크가 드러낸 기존 평가 체계의 구조적 결함이다. 올바른 구현을 제출해도 네 번 중 한 번은 틀렸다고 판정받는 시스템 위에서 AI 코딩 능력을 비교해왔다는 것이 이번에 밝혀졌다. … 더 읽기

Cursor Composer 2.5 정밀 분석

Cursor Composer 2.5 정밀 분석

Cursor가 2026년 5월 18일 공개한 Composer 2.5는 단순한 버전 업그레이드가 아니다. Claude Opus 4.7, GPT-5.5 같은 최고가 프론티어 모델과 벤치마크에서 어깨를 나란히 하면서도 토큰 비용은 10분의 1 수준이라는 주장을 내놓았다. 이 숫자가 사실이라면, AI 코딩 도구 시장의 가격-성능 방정식 자체가 흔들린다. 이미지 출처: Unsplash Cursor는 원래 기존 LLM을 가져다 IDE에 얹는 방식으로 시작했다. GPT-4, Claude, … 더 읽기

AI에게 웹 UI 만들어달라고 할 때 쓰는 프롬프트 모음 1탄

AI에게 웹 UI 만들어달라고 할 때 쓰는 프롬프트 모음 1탄

“이런 디자인 만들어줘”라고 하면 AI는 평범한 결과를 낸다. 구체적인 CSS 속성, 색상 값, 인터랙션 동작까지 명시하면 얘기가 달라진다. Claude, ChatGPT, Cursor 어디에서든 바로 붙여넣을 수 있도록 실제 동작하는 프롬프트 20가지를 카테고리별로 정리했다. 각 항목은 미리보기, 복사 가능한 프롬프트, 간단한 사용 팁으로 구성했다. 미리보기는 실제 CSS로 구현된 컴포넌트라 브라우저에서 바로 확인할 수 있다. 프롬프트는 복사 버튼으로 … 더 읽기

LM Studio MTP로 로컬 LLM 추론 속도 2배 높이기: Gemma 4 & Qwen3 세팅 완전 가이드

LM Studio MTP로 로컬 LLM 추론 속도 2배 높이기: Gemma 4 & Qwen3 세팅 완전 가이드

로컬에서 LLM을 돌리다 보면 결국 속도의 벽을 만난다. 모델 크기를 키울수록 응답이 느려지고, 빠른 소형 모델로 타협하면 품질이 아쉽다. MTP(Multi-Token Prediction) 기반 Speculative Decoding은 이 딜레마를 꽤 영리하게 피해가는 방법이다. 품질은 그대로 두고 속도만 높이는 기법인데, 이제 LM Studio에서 UI 몇 번 클릭만으로 켤 수 있다. LM Studio가 v0.3.10에서 Speculative Decoding을 정식 도입한 것은 2025년 … 더 읽기

“에이전트의 최전선”을 선언한 알리바바의 Qwen3.7-Max

“에이전트의 최전선”을 선언한 알리바바의 Qwen3.7-Max

2026년 5월 14일, Chatbot Arena의 리더보드에 조용히 낯선 이름이 등장했다. 공식 보도자료도 기술 보고서도 없이 말이다. 닷새 뒤인 19일에야 알리바바는 “에이전트의 최전선(The Agent Frontier)”이라는 제목의 블로그 포스트와 함께 Qwen3.7-Max를 정식으로 선언했다. 이 역공개(reverse launch) 방식은 이제 알리바바가 즐겨 쓰는 패턴이 됐다. 커뮤니티가 먼저 발견하고, 실사용 피드백이 쌓이면 그때 숫자를 들고 공식석상에 나타나는 방식이다. Qwen3.7-Max는 현재 … 더 읽기

Cursor가 만든 코딩 모델 Composer 2.5 — GPT-5.5 수준을 10분의 1 가격에

Cursor가 만든 코딩 모델 Composer 2.5 — GPT-5.5 수준을 10분의 1 가격에

Cursor가 5월 18일 자체 에이전틱 코딩 모델 Composer 2.5를 출시했다. 성능은 Claude Opus 4.7, GPT-5.5와 비슷한 수준이라고 주장하지만 가격은 10분의 1 수준이고, 모델의 뼈대는 중국 AI 스타트업 Moonshot AI의 오픈소스 모델 Kimi K2.5다. 이 세 가지 사실이 겹치는 지점에 이번 출시의 진짜 의미가 있다. 단순한 기능 업데이트가 아니라, AI 코딩 도구 시장의 경쟁 방식 자체가 … 더 읽기