Cover image

AI 에이전트 장애 대응: 멀티 모델 폴백 설계

한 줄 요약: AI 에이전트 폴백(fallback)은 다른 모델로 요청을 한 번 더 보내는 기능이 아니다. 정책은 여러 계층에 둘 수 있지만 재시도를 실행하는 계층은 하나로 정하고, 체크포인트·멱등성·장애 격리까지 함께 설계해야 한다. 왜 지금 이슈인가 AI 에이전트 폴백을 검색하면 모델 라우터 설정이 먼저 나온다. 하지만 운영 중인 에이전트를 멈추게 하는 원인은 모델 성능보다 요금 한도, 429 응답, 지연, 컨텍스트 초과, 도구 호출 규격 차이 같은 평범한 문제인 경우가 많다. 이 글의 출발점은 OpenAI 사용량 제한과 결제 상태 때문에 에이전트 실행이 연달아 실패한 사례다. 개인의 경험만으로 전체 서비스의 장애 빈도를 판단할 수는 없다. 다만 결제와 할당량이 재무 문제를 넘어 런타임 의존성이 됐다는 점은 운영 설계에서 무시하기 어렵다. ...

2026년 7월 17일 · 1399 단어 · gnosyslambda
Cover image

LLM 추론 비용 최적화: KV 캐시와 메모리 병목

한 줄 요약: LLM 추론 비용을 GPU FLOPs와 토큰 단가로만 보면, 디코드(Decode) 구간의 실제 병목인 메모리 대역폭(Memory Bandwidth)과 KV 캐시(KV Cache) 비용을 놓치기 쉽다. 모든 워크로드가 메모리 병목인 것은 아니므로 프리필(Prefill)과 디코드를 나눠서 봐야 한다. 왜 지금 이슈인가 LLM 추론 비용, GPU 인프라, KV 캐시 최적화는 실제로는 같은 문제를 다른 말로 설명하는 경우가 많다. 모델을 처음 띄울 때는 GPU 사용률, 초당 토큰 수, 시간당 인스턴스 비용을 먼저 본다. 그런데 트래픽이 늘고 대화 컨텍스트가 길어지면 계산이 달라진다. ...

2026년 7월 11일 · 1421 단어 · gnosyslambda
Cover image

AWS SNS 메시지 유실 막는 필터 계약 테스트

한 줄 요약: AWS SNS 메시지 필터는 장애가 없어도 메시지를 버릴 수 있다. 이벤트 기반 아키텍처에서 실제 계약을 보려면 퍼블리셔 코드만 보지 말고 토픽, 구독, 필터 정책을 같이 봐야 한다. 왜 지금 이슈인가 이벤트 기반 아키텍처(Event-driven Architecture)는 서비스 사이의 직접 호출을 줄이는 데 도움이 된다. 그런데 운영에서는 문제의 위치가 더 멀리 숨어 보일 때가 많다. 호출 관계가 줄어든 만큼, 메시지가 어디에서 멈췄는지 한눈에 보이지 않는다. AWS SNS(Simple Notification Service)에서 특히 헷갈리는 부분이 필터 정책(Filter Policy)이다. 퍼블리셔가 토픽에 메시지를 발행하면 MessageId가 반환된다. 예외도 없고, 재시도도 없고, 데드 레터 큐(Dead Letter Queue)에도 아무것도 없다. ...

2026년 7월 11일 · 1158 단어 · gnosyslambda
Cover image

AI 에이전트 웹사이트 최적화: llms.txt와 MCP

한 줄 요약: AI 에이전트 시대의 웹 최적화는 HTML 용량을 줄이는 일이 아니라, 어떤 데이터를 어떤 비용과 권한으로 읽게 할지 정하는 인터페이스 설계에 가깝다. 왜 지금 이슈인가 AI 에이전트가 웹사이트를 읽을 때 쓰는 토큰 비용은 이제 에이전트 개발자만의 문제가 아니다. 페이지가 무거우면 에이전트는 내비게이션, 스타일, 스크립트, 구조화 데이터까지 함께 읽고, 그만큼 토큰 예산을 쓴다. 원문은 이 문제를 웹사이트 소유자의 책임으로 돌려본다. 브라우저에는 기존 HTML을 주고, 에이전트가 요청하면 같은 URL에서 마크다운(Markdown) 형태를 주는 콘텐츠 협상(Content Negotiation)을 제안한다. llms.txt는 사이트 구조를 한 번에 알려주는 지도 역할을 한다. ...

2026년 7월 11일 · 1219 단어 · gnosyslambda
Cover image

MCP 서버 구축과 AI 에이전트 보안 설계

한 줄 요약: MCP 서버는 AI 에이전트에 기능을 붙이는 편한 어댑터가 아니라 모델이 호출하는 프로덕션 API다. 관건은 도구를 많이 여는 데 있지 않다. 권한, 관측성, 응답 크기, 실패 반경을 얼마나 좁힐 수 있느냐다. 왜 지금 MCP 서버와 AI 에이전트 보안이 이슈인가 MCP(Model Context Protocol)를 붙이면 Claude Code 같은 AI 에이전트가 로컬 CLI, 사내 API, 데이터베이스, GitHub 저장소를 직접 다룰 수 있다. 문제는 바로 그 지점에서 생긴다. 사람이 복사해서 붙여 넣던 JSON 응답을 모델이 직접 가져오는 순간, 생산성 이야기는 아키텍처와 보안 문제로 바뀐다. ...

2026년 7월 11일 · 1543 단어 · gnosyslambda
Cover image

AI 에이전트 런타임 검증과 상태 관리

한 줄 요약: AI 에이전트의 신뢰성은 프롬프트 품질만으로 정해지지 않는다. 런타임 상태 검사와 기계적 검증이 같이 있어야 한다. 다만 모든 동작을 게이트로 막는 방식도 답은 아니어서, 상태 머신과 승인 이벤트, 구조 검사를 어디에 둘지 설계해야 한다. 왜 지금 이슈인가 AI 에이전트 런타임, 상태 머신, 테스트 하네스가 실무 쟁점이 된 이유는 분명하다. 예전에는 에이전트가 채팅창 안에서 답변만 만들었고, 실패도 대체로 텍스트 품질 문제로 보였다. 지금은 다르다. 파일을 고치고, 도구를 호출하고, 백그라운드에서 계속 실행되며, 사람의 승인을 기다린다. ...

2026년 7월 11일 · 1352 단어 · gnosyslambda
Cover image

ingress-nginx 지원 종료와 Gateway API 전환 전략

한 줄 요약: Kubernetes ingress-nginx 종료는 Gateway API로 바로 갈아타라는 뜻이 아니다. 먼저 해야 할 일은 컨트롤러를 바꾸는 것이 아니라, 현재 트래픽 규칙과 보안 대응 절차를 코드와 운영 데이터로 확인하는 것이다. 왜 지금 Kubernetes ingress-nginx 종료가 이슈인가 Kubernetes ingress-nginx는 많은 클러스터에서 인터넷 요청이 서비스로 들어오는 첫 관문이었다. 2026년 3월부터 Kubernetes SIG Network가 ingress-nginx 유지보수를 중단했고, 7월 9일 CNCF 글은 앞으로 보안 패치와 기능 작업을 기대하기 어렵다는 점을 운영자에게 다시 알렸다. ...

2026년 7월 11일 · 1206 단어 · gnosyslambda
Cover image

AI 에이전트 자동화와 평가 하네스 설계

한 줄 요약: AI 에이전트 자동화는 프롬프트 파일을 잘 쓰는 문제라기보다 Agent Skills, 테스트 자동화, 평가 루프, 코드 규칙, 운영 관측성을 묶어 재현 가능한 워크플로로 만드는 문제다. 왜 지금 이슈인가 AI 에이전트로 콘텐츠를 만들고, 코드를 고치고, PR을 열고, 리뷰까지 맡기는 팀이 늘어나면 먼저 부딪히는 벽은 모델 성능이 아니다. 같은 요청을 넣었는데 오늘은 되고 내일은 안 되는 재현성이다. DEV Community의 사례는 이 문제를 작게 보여준다. 처음에는 .github/prompts/ 아래에 비디오, 팟캐스트, 블로그용 프롬프트 파일을 따로 두었다. 각 프롬프트는 URL을 받아 메타데이터를 추출하고 마크다운 파일을 만드는 정도였다. ...

2026년 7월 11일 · 1358 단어 · gnosyslambda
Cover image

Modbus 프록시 장애 대응 설계

한 줄 요약: Modbus 프록시와 캐시 프록시에서 중요한 것은 빠른 응답만이 아니다. stale cache를 현재 데이터처럼 내보내지 않도록 관측성과 타임아웃을 설계해야 한다. 장애를 숨기는 캐시는 장애가 드러난 시스템보다 다루기 어렵다. 왜 지금 이슈인가 Kubernetes, 홈 오토메이션, 산업 장비, 데이터 파이프라인을 보면 원천 데이터 앞에 캐시 프록시를 두는 경우가 많다. 이유는 단순하다. 원천 시스템이 느리거나 비싸거나 불안정하고, 너무 자주 읽으면 문제가 생기기 때문이다. 원문의 Modbus 프록시 사례는 작은 태양광 인버터 연동 이야기처럼 보인다. 하지만 개발자들이 바로 공감할 만한 문제가 있다. 화면은 계속 숫자를 보여주는데, 그 숫자가 더 이상 현재값이 아닐 수 있다는 점이다. ...

2026년 7월 10일 · 1317 단어 · gnosyslambda
Cover image

Git Hooks로 AI 코드 리뷰 가드레일 만들기

한 줄 요약: Git hooks는 AI 코드 리뷰, 테스트 자동화, 인프라 코드 배포를 연결하는 가까운 위험 감지 지점이다. 다만 훅 자체를 보안 장치로 믿으면 실패하고, 리뷰 라우팅과 증거 수집 장치로 설계해야 한다. 왜 지금 이슈인가 AI가 코드를 쓰기 시작하면서 Git workflow의 의미가 바뀌고 있다. 예전에는 커밋이 사람이 생각을 정리한 결과물에 가까웠다면, 이제는 AI 에이전트가 만든 패치, 사람이 부분 수정한 코드, 자동 생성된 인프라 코드(Infrastructure as Code)가 같은 브랜치에 섞인다. 선정 글감의 Diff Sniffer는 이 변화를 현실적인 수준에서 짚는다. 도구가 하는 일은 단순하다. AI가 작성한 커밋이고, 미리 지정한 위험 경로를 건드렸고, 사람 리뷰가 없을 때만 경고한다. AI 모델을 다시 호출하지 않고 Git trailer와 path glob만 본다. ...

2026년 7월 10일 · 1331 단어 · gnosyslambda