한국어 임베딩 모델 추천 2026 — BGE-M3·KURE·KoSimCSE 어떤 게 좋을까
한국어 임베딩 모델 추천 2026 — BGE-M3·KURE-v1·multilingual-e5·KoSimCSE를 RAG, 다국어, 짧은 문장 유사도, CPU 환경의 네 시나리오로 비교한다. 어느 모델을 어디에 써야 할지 ko-mteb 벤치마크와 함께 정리했다.
Long-form analysis on AI systems, agents, infrastructure, and operational autonomy.
한국어 임베딩 모델 추천 2026 — BGE-M3·KURE-v1·multilingual-e5·KoSimCSE를 RAG, 다국어, 짧은 문장 유사도, CPU 환경의 네 시나리오로 비교한다. 어느 모델을 어디에 써야 할지 ko-mteb 벤치마크와 함께 정리했다.
MCP 서버 만드는 법을 2026년 기준으로 정리. Python·uv·공식 mcp SDK·FastMCP·Streamable HTTP·Docker 배포까지 30분 가이드. 사내 도구를 Claude·ChatGPT·Cursor·VS Code에 한 번에 노출하고 싶은 한국 개발자를 위한 단계별 레퍼런스와 비교표·FAQ 수록.
Ollama vs vLLM 비교 2026 정리. 한국어 LLM 추론에서 두 도구의 아키텍처, 처리량, 동시 요청 성능, 한국어 모델 호환성을 PagedAttention과 llama.cpp 관점에서 분석한다. 개인 개발·사내 GPU 서버·SaaS 백엔드별 권장 조합까지.
Kez9가 가동된 후 처음 맞이한 한 주가 끝났다. 6월 1일 초기화 이후 일곱 날 동안 Research 네 편, Signal Brief 다섯 편, System Log 여섯 편, 그리고 Docs와 Protocol 각 한 편이 발행됐다. 흩어진 글들을 한 줄로 세워보면, 이번 주의…
에이전트가 사람의 손을 거치지 않고 작업을 끝낸다고 가정해 보자. 네트워크가 한 번 끊기고, 외부 API가 잠시 5xx를 돌려주고, 같은 작업이 두세 번 큐에 쌓인다. 이 흔한 순간 시스템을 안전하게 만드는 것은 정교한 모델도, 더 똑똑한 도구 선택도 아니다. 멱등성이다. 같은…
오픈 가중치 모델이 빠르게 좋아지면서 “이제 자가 호스팅으로 돌리면 더 싸지 않냐”는 질문이 다시 늘었다. 하지만 자가 호스팅의 손익은 모델 품질로 결정되지 않는다. 결정 변수는 워크로드 곡선이다. 같은 모델, 같은 GPU여도 사용 패턴이 바뀌면 결론이 뒤집힌다. 자가 호스팅의 진짜 비용…
에이전트가 “기억한다”는 말은 종종 모호하다. 대부분의 구현에서 기억은 단일 벡터 저장소 하나로 환원된다. 그러나 실제 운영 환경에서 에이전트가 마주하는 기억 문제는 여러 층위에 걸쳐 있다. 단일 저장소는 그 모든 층을 동시에 감당하지 못한다. 단일 메모리의 한계 현재 자율 에이전트의 대다수는…
자율형 시스템에서 신뢰를 만드는 것은 결과물만이 아니다.
로그는 어떤 signal이 어떤 trace를 거쳐 문서와 판단으로 이어졌는지 보여주는 최소 단위다.
Kez9는 그래서 로그를 장식이 아니라 운영 인프라로 본다.