Moonshot AI · 텍스트

Hermes Agent x Kimi

kimi-k3는 Kimi의 현재 플래그십으로 추론이 항상 활성화되며, 첫 제공은 기본 텍스트 동기식 및 SSE로 한정됩니다. kimi-k2.5와 kimi-k2.6도 계속 사용할 수 있습니다. 256K 컨텍스트, 네이티브 멀티모달 입력, SWE-bench Pro 등은 해당 K2 버전에만 적용됩니다. OpenAI Chat Completions, OpenAI Responses, Anthropic Messages, Gemini native 인터페이스로 호출할 수 있습니다.

4 variants 최저 $0.57 / 100만 토큰 상업적 사용 지원

Prerequisite: npx runapi mcp install

Prompt

프롬프트 모델

작업에 맞는 경우 kimi-k2.5를 사용하세요: 1T / 32B 활성, 256K 컨텍스트, 네이티브 멀티모달 입력.

You have access to RunAPI chat models for Kimi.

Available Kimi models:
- kimi-k2.5: 1T / 32B 활성, 256K 컨텍스트, 네이티브 멀티모달 입력
  chat endpoints: /v1/chat/completions
- kimi-k2.6: 1T / 32B 활성, 256K 컨텍스트, 58.6% SWE-bench Pro, 300-agent swarm
  chat endpoints: /v1/chat/completions
- kimi-k2.7-code: 코딩 전용 모델, 항상 켜진 Thinking, 256K 컨텍스트
  chat endpoints: /v1/chat/completions
- kimi-k3: 추론이 항상 활성화된 Kimi 최신 플래그십 모델
  chat endpoints: /v1/chat/completions

Use the model ID and chat endpoint that match the user's request.
Example request: 작은 CLI 도구를 계획하고 구현하세요. 프로젝트를 스캐폴드하고, 명령을 작성하고, 테스트를 추가한 뒤 통과할 때까지 실행하세요.
Verify the active model with: hermes model;hermes doctor

공개 버전 및 엔드포인트

모델 ID 엔드포인트 시작 가격 모델 카탈로그
kimi-k2.5
/v1/chat/completions
$0.60 / 100만 토큰 모델 상세
kimi-k2.6
/v1/chat/completions
$0.95 / 100만 토큰 모델 상세
kimi-k2.7-code
/v1/chat/completions
$0.57 / 100만 토큰 모델 상세
kimi-k3
/v1/chat/completions
$3.00 / 100만 토큰 모델 상세

검증

Task가 최종 상태에 도달할 때까지 폴링합니다

<model-id>를 선택하면 검증 명령을 생성합니다.

설정

가이드 엔드포인트: <endpoint>

<model-id>를 선택하면 엔드포인트의 공개 입력 계약에 맞는 요청을 생성합니다.
사용 절차

3단계로 시작하기

  1. 모델 ID 선택

    공개 모델 ID를 선택하고 엔드포인트와 현재 시작 가격을 확인합니다.

  2. RunAPI 설정

    이 Agent의 Provider 설정을 추가합니다.

  3. 결과 검증

    아래 Agent 상태 및 모델 선택 명령을 실행합니다.

Hermes Agent + Kimi로 만들 수 있는 것

  • 에이전트 코딩과 추론

    모델의 추론 능력으로 에이전트가 코드를 계획, 작성, 검토하거나 여러 단계의 문제를 해결하게 할 수 있습니다.

  • 긴 문서 분석과 추출

    보고서, 계약서, 코드베이스를 요약하고 긴 문서에서 구조화된 필드를 추출합니다.

  • 도구 호출 워크플로

    모델을 함수와 API에 연결해 에이전트가 응답 사이에 데이터를 조회하고 작업을 실행하도록 합니다.

Kimi을(를) RunAPI + Hermes Agent로 사용하는 이유

  • 4개 변형 모델, 하나의 API 키

    하나의 RunAPI 연결에서 사용 가능한 모델 변형을 선택할 수 있어 통합 방식을 바꿀 필요가 없습니다.

  • 명확한 사용 요금

    요청을 보내기 전에 현재 카탈로그 요금을 확인하세요. 구독이나 최소 사용 금액이 없습니다.

  • 즉시 응답

    동기 호출은 같은 응답 안에 결과를 반환하므로 에이전트가 작업 상태를 폴링하지 않고 바로 결과를 사용할 수 있습니다.

Hermes Agent + Kimi 자주 묻는 질문

현재 Kimi 플래그십은 무엇인가요?

kimi-k3입니다. 추론이 항상 활성화되며 RunAPI의 첫 제공은 기본 텍스트 동기식 및 SSE입니다.

kimi-k2.5와 kimi-k2.6의 차이점은 무엇인가요?

둘 다 K2 아키텍처입니다. K2는 총 1조 파라미터, 토큰당 32B 활성 파라미터, 레이어당 384개 전문가의 MoE입니다. kimi-k2.5는 256K 컨텍스트와 네이티브 멀티모달 입력을 제공하고, kimi-k2.6은 SWE-bench Pro 58.6%를 기록합니다. 이 K2 정보는 kimi-k3에 적용되지 않습니다.

어떤 SDK로 RunAPI에서 Kimi를 호출할 수 있나요?

OpenAI Chat Completions, OpenAI Responses, Anthropic Messages, Gemini native 인터페이스를 사용하고 선택한 Kimi 모델 ID를 전달하세요.

Kimi는 어떻게 과금되나요?

각 Kimi 모델의 현재 가격은 RunAPI catalog의 해당 모델 페이지에서 확인하세요.

어떤 모델 ID를 사용해야 하나요?

버전 표에서 공개 모델 ID를 선택하세요. 각 ID가 제공하는 엔드포인트는 해당 행에 표시됩니다.

이 가이드는 채팅 모델을 설정하나요?

예. 이 Model Line은 클라이언트용 LLM 프로토콜을 지원합니다.

Hermes Agent에서 Kimi 사용 시작하기

팀과 함께 구축하고 계신가요?

엔터프라이즈 설정, 통합, 기술 문의를 도와드립니다.

문의하기