Pi와 DeepSeek V4.1-Flash 조합은 리얼월드 백엔드 구현 실험에서 세 번 모두 완주했다. 가장 빠른 실행은 1.9분, Pi가 기록한 비용 환산값은 $0.037이었다.1

정도현 - 로보코 수석 컨설턴트


코딩 에이전트는 많다. Claude Code와 Codex처럼 모델 개발사가 만든 도구도 있고, 여러 모델을 연결하는 독립적인 도구도 있다. 기능 목록은 길어졌지만, 실제 작업에서는 에이전트의 동작을 바꾸기 어렵거나 내가 원하지 않는 절차를 따라야 하는 순간이 남아 있다. Pi는 이 지점에서 눈에 띈다. 기본 기능을 작게 유지하고, 필요한 기능은 사용자가 붙이게 하는 코딩 에이전트다.2

이 글에서는 Pi가 누가 만든 도구인지, 어떻게 작동하는지, 그리고 우리 리얼월드 백엔드 구현 벤치마크에서 어떤 결과를 냈는지 살펴본다.

TL;DR

  • Pi는 마리오 제크너가 만든 작은 코딩 에이전트다. 기본 도구를 조합하고 필요한 기능을 확장하는 방식은 유닉스 철학을 떠올리게 한다.
  • 리얼월드 백엔드 벤치마크에서 Pi의 다섯 모델 조합이 각각 3회 모두 완주했다. DeepSeek V4.1-Flash 조합의 최단 기록은 1.9분·환산 비용 $0.037이지만, 한 번의 기록을 일반적인 성능으로 볼 수는 없다.
  • AGENTS.md와 CLAUDE.md 같은 프로젝트 지침을 재사용할 수 있고, DeepSeek V4.1-Flash는 공개 가중치를 자체 환경에 배포할 수 있다. 에이전트별 설정과 셀프 호스팅 성능은 별도로 확인해야 한다.

1. Pi를 만든 사람은 누구인가

Pi를 만든 마리오 제크너(Mario Zechner) 는 오픈소스 개발 경험이 긴 개발자다. 대표작인 libGDX는 여러 플랫폼에서 게임을 개발하는 프레임워크다. 그는 JVM 애플리케이션을 iOS에서 실행하게 해 주던 RoboVM 프로젝트에도 초기부터 참여해 디버거 개발을 맡았다. 두 프로젝트를 거치며 개발 도구와 오픈소스 커뮤니티를 운영해 온 이력이 있다.3

제크너는 여러 AI 에이전트를 만들고 기존 코딩 도구를 사용하면서, 모델에 무엇이 전달되는지 직접 파악하고 제어하기 어렵다는 문제를 느꼈다. 자체 호스팅 모델과의 연동에도 아쉬움이 있었다. 그래서 다중 모델을 연결하는 pi-ai, 도구 실행을 반복하는 pi-agent-core, 터미널 화면을 맡는 pi-tui, 이를 묶은 pi-coding-agent를 차례로 만들었다. 자신에게 필요하지 않은 기능은 기본 제품에 넣지 않는다는 선택도 이 과정에서 자리 잡았다.4

Flask를 만든 아르민 로나허(Armin Ronacher) 는 Pi를 사용하고 공개적으로 소개해 왔다. 2026년 4월 제크너가 로나허가 속한 Earendil에 Pi와 함께 합류했다. 제크너의 설명에 따르면 이후 Pi의 기술 방향과 로드맵은 로나허, 콜린 해나와 함께 결정하며, 제크너가 개발을 이끌고 있다.53

2. 작은 핵심에 필요한 기능을 붙인다

Pi의 기본 동작은 단순하다. 사용자의 요청과 현재 대화, 프로젝트 지침, 사용할 도구를 모델에 보낸다. 모델이 도구 호출을 반환하면 Pi가 실행하고 결과를 다시 모델에 전달한다. 작업이 끝날 때까지 이 과정을 반복한다. 기본 도구는 파일 읽기, 파일 쓰기, 편집, 셸 명령 실행 네 가지다.26

작다고 해서 작업 범위가 좁은 것은 아니다. 공식 사이트에 따르면 확장(extensions)으로 새 도구와 명령, 화면 요소를 추가할 수 있고, 스킬과 프롬프트 템플릿도 사용할 수 있다. 기본 제공하지 않는 서브에이전트나 계획 모드도 필요하면 확장으로 구성한다. 대화 기록은 트리로 저장해 이전 지점에서 새 가지를 만들 수 있으며, 작업 도중 모델을 바꾸는 기능도 있다.2 Pi를 일종의 수정 가능한 에이전트 실행 환경으로 볼 수 있는 이유다.

이 설계가 모든 작업에서 더 빠르다는 뜻은 아니다. 다만 시스템 프롬프트, 도구, 문맥을 사용자가 파악하고 조정할 여지가 크다. 제크너가 Pi를 만들며 강조한 것도 바로 이 통제 가능성이었다.4

이런 구현 방식은 한 가지 일을 잘하는 작은 도구를 만들고, 이를 조합해 복잡한 일을 처리하는 유닉스 철학을 떠올리게 한다. Pi가 파일 읽기·쓰기·편집과 셸 실행을 기본 요소로 두고, 나머지는 필요에 따라 확장하는 방식이 그렇다. 이것은 Pi 개발자가 유닉스 철학을 설계 원칙으로 선언했다는 뜻이 아니라, 필자가 Pi를 사용하며 발견한 닮은 점이다.

3. 실제 백엔드 구현에서는 어땠나

우리 벤치마크는 에이전트에게 RealWorld 백엔드를 새로 구현하게 한다. 사람이 중간에 코드를 고치지 않고, 공식 Hurl 검증 항목 13개 파일·154개 요청을 통과하는지 확인한다. 비교 단위는 모델 하나가 아니라 모델·에이전트·추론 설정·연결 방식의 조합이다.7

Pi 실험에서는 DeepSeek V4.1-Flash, kimi-k3, qwen3.8-max, Claude Opus 5.5, gpt-6-sol을 각각 영어 프롬프트로 세 번 실행했다. 다섯 조합 모두 3회 중 3회 완주했다.18

Pi 조합 완주 세션 시간 중앙값 비용 관련 수치
DeepSeek V4.1-Flash 3/3 약 3.3분 Pi 기록 환산값 중앙값 $0.059
Claude Opus 5.5 3/3 약 3.9분 공개 API 단가 환산 중앙값 $0.81
gpt-6-sol 3/3 약 4.4분 공개 API 단가 환산 중앙값 $0.27

DeepSeek 조합의 최단 실행은 1.9분, $0.037, 달러당 1,500원을 가정하면 약 56원이다. 흔히 말하는 ‘2분·55원’은 이 한 번의 최단 기록을 반올림한 표현이다. 세 번의 대표값은 약 3.3분·$0.059이며, 비용은 실제 청구액이 아니라 Pi가 기록한 단가 환산값이다.1 환율에 따라 원화 금액도 달라진다.

같은 모델을 제조사의 에이전트에서 실행한 기록과 견주면 흥미롭다. 영어 조건에서 Pi × Opus 5.5는 중앙값 3.9분·환산 비용 $0.81, Claude Code × Opus 5.5는 4.2분·$1.25였다. Pi × gpt-6-sol은 4.4분·$0.27, Codex × gpt-6-sol은 4.9분·$0.43이었다.8 두 Pi 조합의 출력 토큰도 비교 기준보다 적었다. 그러나 실행 시간의 범위는 겹친다. 또한 에이전트뿐 아니라 API 경로, 캐시 설정, 실행 시점도 달랐다. 이 차이를 Pi 자체의 성능 향상으로 단정할 수는 없다. 과제도 하나, 조건당 반복도 세 번이다.

그럼에도 이 결과는 의미가 있다. Pi가 다양한 모델을 연결해 같은 백엔드 과제를 완주했고, 일부 조합에서는 메이저 개발사의 전용 에이전트와 견줄 만한 시간과 적은 환산 비용을 기록했다. 현재로서는 ‘우월성 입증’보다 실무에서 시험해 볼 만한 선택지가 늘었다는 결론이 정확하다.

필자도 요즘 Pi와 DeepSeek V4.1-Flash를 조합해 여러 작업을 실험하고 있다. 빠른 응답과 작업을 끝까지 밀고 가는 능력이 인상적이었다. 이는 필자의 사용 경험이며, 위 벤치마크와 별개의 관찰이다. 어떤 작업에서든 같은 결과가 나온다는 뜻은 아니다.

DeepSeek 모델을 외부 API로 사용할 때 데이터가 어디에서 처리되는지 우려하는 조직이라면, 배포 방식도 살펴볼 만하다. DeepSeek는 V4.1-Flash의 모델 가중치를 공개했고, 모델 카드에 로컬 추론 안내도 제공한다. 따라서 필요한 하드웨어와 운영 역량을 갖추면 자체 환경에 배포할 수 있다.9 다만 이번 벤치마크는 DeepSeek API로 실행했다. 셀프 호스팅에서 같은 속도나 비용이 나온다는 검증은 아니다.

4. 기존 에이전트 설정을 얼마나 재사용할 수 있나

Claude Code나 Codex를 쓰던 프로젝트라면 새 에이전트를 시작할 때 설정을 다시 만드는 일이 번거롭다. Pi는 이 부담을 프로젝트 지침과 스킬 수준에서 줄여 준다. 공식 문서에 따르면 Pi는 작업 디렉터리와 상위 디렉터리의 AGENTS.md와 CLAUDE.md를 문맥 파일로 읽는다. 따라서 기존에 작성한 프로젝트 규칙을 Pi에서도 참고할 수 있다.10

스킬은 경로를 확인해야 한다. Pi는 .pi/skills/와 공통 Agent Skills 경로인 .agents/skills/를 탐색한다. 기존 스킬을 .claude/skills/나 .codex/skills/에만 두었다면, Pi의 settings.json에 해당 경로를 추가해 사용할 수 있다.1112 특히 여러 에이전트에서 함께 쓸 스킬은 공통 .agents/skills/에 두는 편이 간단하다.

그렇다고 Claude Code나 Codex의 모든 설정을 그대로 가져오는 것은 아니다. Pi의 모델·인증·확장·단축키 설정은 자체 .pi/ 및 ~/.pi/agent/ 파일로 관리한다.10 기존 스킬이나 지침이 특정 도구 이름, 훅, 전용 명령에 의존한다면 Pi에서 실제로 동작하는지 확인하고 필요한 부분을 고쳐야 한다. 프로젝트 규칙은 쉽게 이어받을 수 있지만, 도구별 동작까지 자동 이전되는 것은 아니다.

5. 구독 계정으로 모델을 고를 수 있다

Pi는 여러 제공자의 API 키와 로그인 방식을 지원한다. 이번 gpt-6-sol 실험은 ChatGPT 구독 계정의 OAuth 로그인으로 실행했다. 따라서 사용자는 Pi에서 GPT를 돌리고 Codex에서 같은 계열 모델을 돌려 보며, 자신의 작업에 맞는 환경을 고를 수 있다.28

Claude는 조건을 구분해야 한다. Anthropic은 서드파티 도구에서 Claude를 사용할 때 Console API 키 또는 지원 클라우드 제공자를 통한 인증을 권장한다. 이번 Pi × Opus 5.5 실험도 Anthropic API 키를 사용했다.813 ChatGPT 구독 사용과 API 단가 환산값을 같은 ‘실제 지출’로 비교해서는 안 된다. 구독에는 사용량 한도가 있고, gpt-6-sol 행의 $0.27은 실제 청구액이 아닌 비교용 환산값이다.8


결론

Pi를 주목할 이유는 기능이 가장 많아서가 아니다. 네 가지 기본 도구에서 시작해 작업 방식에 맞게 확장할 수 있고, 여러 모델을 같은 환경에서 써 볼 수 있다. 벤치마크에서도 다섯 모델 조합이 모두 주어진 백엔드 과제를 완주했다. 특히 DeepSeek의 최단 기록은 속도와 비용 면에서 눈길을 끈다.

다음 질문은 한 번의 빠른 기록을 넘어서는 것이다. 같은 모델과 같은 API 조건으로 에이전트만 바꿔 반복 실행하고, 버그 수정이나 기존 코드 변경에도 결과가 유지되는지 봐야 한다. Pi는 이미 그 비교에 넣을 가치가 있는 코딩 에이전트다.



  1. ROBOCO.IO, EXP-029 Pi 오픈 모델 실험 보고서: https://github.com/roboco-io/coding-agent-benchmark/blob/main/experiments/029-pi-openweight/report.md ↩︎ ↩︎ ↩︎

  2. Pi 공식 사이트: https://pi.dev/ ↩︎ ↩︎ ↩︎ ↩︎

  3. Mario Zechner, “I’ve sold out”: https://mariozechner.at/posts/2026-04-08-ive-sold-out/ ↩︎ ↩︎

  4. Mario Zechner, “What I learned building an opinionated and minimal coding agent”: https://mariozechner.at/posts/2025-11-30-pi-coding-agent/ ↩︎ ↩︎

  5. Armin Ronacher, “Mario and Earendil”: https://lucumr.pocoo.org/2026/4/8/mario-and-earendil/ ↩︎

  6. Pi 공식 문서, “How Pi Works”: https://pi.dev/docs/latest/how-pi-works ↩︎

  7. ROBOCO.IO, 코딩 에이전트 벤치마크 개요와 방법론: https://github.com/roboco-io/coding-agent-benchmark ↩︎

  8. ROBOCO.IO, EXP-030 Pi 프런티어 모델 실험 보고서: https://github.com/roboco-io/coding-agent-benchmark/blob/main/experiments/030-pi-frontier/report.md ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  9. DeepSeek, “DeepSeek-V4.1-Flash” 모델 카드 및 로컬 추론 안내: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash ↩︎

  10. Pi 공식 문서, “Configuration”: https://pi.dev/docs/latest/configuration ↩︎ ↩︎

  11. Pi 공식 문서, “Skills”: https://pi.dev/docs/latest/skills ↩︎

  12. Pi 공식 문서, “Settings Reference”: https://pi.dev/docs/latest/settings ↩︎

  13. Anthropic Help Center, “Log in to your Claude account”: https://support.claude.com/en/articles/13189465-log-in-to-your-claude-account ↩︎