jpskill.com
🛠️ 開発・MCP コミュニティ

agent-media

画像、動画、音声の加工に特化したツールキットで、リサイズや形式変換、背景除去、音声抽出、文字起こし、動画生成など、様々な処理をJSON形式で実行できるSkill。

📜 元の英語説明(参考)

Agent-first media toolkit for image, video, and audio processing. Use when you need to resize, convert, generate images, remove backgrounds, extract audio, transcribe speech, or generate videos. All commands return deterministic JSON output.

🇯🇵 日本人クリエイター向け解説

一言でいうと

画像、動画、音声の加工に特化したツールキットで、リサイズや形式変換、背景除去、音声抽出、文字起こし、動画生成など、様々な処理をJSON形式で実行できるSkill。

※ jpskill.com 編集部が日本のビジネス現場向けに補足した解説です。Skill本体の挙動とは独立した参考情報です。

⚡ おすすめ: コマンド1行でインストール(60秒)

下記のコマンドをコピーしてターミナル(Mac/Linux)または PowerShell(Windows)に貼り付けてください。 ダウンロード → 解凍 → 配置まで全自動。

🍎 Mac / 🐧 Linux
mkdir -p ~/.claude/skills && cd ~/.claude/skills && curl -L -o agent-media.zip https://jpskill.com/download/10474.zip && unzip -o agent-media.zip && rm agent-media.zip
🪟 Windows (PowerShell)
$d = "$env:USERPROFILE\.claude\skills"; ni -Force -ItemType Directory $d | Out-Null; iwr https://jpskill.com/download/10474.zip -OutFile "$d\agent-media.zip"; Expand-Archive "$d\agent-media.zip" -DestinationPath $d -Force; ri "$d\agent-media.zip"

完了後、Claude Code を再起動 → 普通に「動画プロンプト作って」のように話しかけるだけで自動発動します。

💾 手動でダウンロードしたい(コマンドが難しい人向け)
  1. 1. 下の青いボタンを押して agent-media.zip をダウンロード
  2. 2. ZIPファイルをダブルクリックで解凍 → agent-media フォルダができる
  3. 3. そのフォルダを C:\Users\あなたの名前\.claude\skills\(Win)または ~/.claude/skills/(Mac)へ移動
  4. 4. Claude Code を再起動

⚠️ ダウンロード・利用は自己責任でお願いします。当サイトは内容・動作・安全性について責任を負いません。

🎯 このSkillでできること

下記の説明文を読むと、このSkillがあなたに何をしてくれるかが分かります。Claudeにこの分野の依頼をすると、自動で発動します。

📦 インストール方法 (3ステップ)

  1. 1. 上の「ダウンロード」ボタンを押して .skill ファイルを取得
  2. 2. ファイル名の拡張子を .skill から .zip に変えて展開(macは自動展開可)
  3. 3. 展開してできたフォルダを、ホームフォルダの .claude/skills/ に置く
    • · macOS / Linux: ~/.claude/skills/
    • · Windows: %USERPROFILE%\.claude\skills\

Claude Code を再起動すれば完了。「このSkillを使って…」と話しかけなくても、関連する依頼で自動的に呼び出されます。

詳しい使い方ガイドを見る →
最終更新
2026-05-18
取得日時
2026-05-18
同梱ファイル
1

📖 Skill本文(日本語訳)

※ 原文(英語/中国語)を Gemini で日本語化したものです。Claude 自身は原文を読みます。誤訳がある場合は原文をご確認ください。

Agent Media

Agent Media は、画像、ビデオ、およびオーディオ処理のための CLI からアクセス可能なコマンドを提供する、エージェントファーストのメディアツールキットです。すべてのコマンドは、決定論的な、機械可読な JSON 出力を生成します。

利用可能なコマンド

画像コマンド

  • agent-media image resize - 画像のリサイズ
  • agent-media image convert - 画像フォーマットの変換
  • agent-media image remove-background - 画像の背景の削除
  • agent-media image generate - テキストからの画像の生成

オーディオコマンド

  • agent-media audio extract - ビデオからのオーディオの抽出
  • agent-media audio transcribe - オーディオからテキストへの書き起こし

ビデオコマンド

  • agent-media video generate - テキストまたは画像からのビデオの生成

出力フォーマット

すべてのコマンドは、JSON を標準出力に出力します。

{
  "ok": true,
  "media_type": "image",
  "action": "resize",
  "provider": "local",
  "output_path": "output_123.webp",
  "mime": "image/webp",
  "bytes": 12345
}

エラーの場合:

{
  "ok": false,
  "error": {
    "code": "INVALID_INPUT",
    "message": "input file not found"
  }
}

プロバイダ

  • local - Sharp (resize, convert) および Transformers.js (remove-background, transcribe) を使用するデフォルトのプロバイダ
  • fal - fal.ai プロバイダ (generate, edit, remove-background, transcribe, video)
  • replicate - Replicate API (generate, edit, remove-background, transcribe, video)
  • runpod - Runpod API (generate, edit)
  • ai-gateway - Vercel AI Gateway (generate, edit)

プロバイダの選択

  1. 明示的: --provider <name>
  2. 環境変数からの自動検出
  3. ローカルプロバイダへのフォールバック

環境変数

  • AGENT_MEDIA_DIR - カスタム出力ディレクトリ
  • FAL_API_KEY - fal プロバイダの有効化
  • REPLICATE_API_TOKEN - replicate プロバイダの有効化
  • RUNPOD_API_KEY - runpod プロバイダの有効化
  • AI_GATEWAY_API_KEY - ai-gateway プロバイダの有効化
📜 原文 SKILL.md(Claudeが読む英語/中国語)を展開

Agent Media

Agent Media is an agent-first media toolkit that provides CLI-accessible commands for image, video, and audio processing. All commands produce deterministic, machine-readable JSON output.

Available Commands

Image Commands

  • agent-media image resize - Resize an image
  • agent-media image convert - Convert image format
  • agent-media image remove-background - Remove image background
  • agent-media image generate - Generate image from text

Audio Commands

  • agent-media audio extract - Extract audio from video
  • agent-media audio transcribe - Transcribe audio to text

Video Commands

  • agent-media video generate - Generate video from text or image

Output Format

All commands return JSON to stdout:

{
  "ok": true,
  "media_type": "image",
  "action": "resize",
  "provider": "local",
  "output_path": "output_123.webp",
  "mime": "image/webp",
  "bytes": 12345
}

On error:

{
  "ok": false,
  "error": {
    "code": "INVALID_INPUT",
    "message": "input file not found"
  }
}

Providers

  • local - Default provider using Sharp (resize, convert) and Transformers.js (remove-background, transcribe)
  • fal - fal.ai provider (generate, edit, remove-background, transcribe, video)
  • replicate - Replicate API (generate, edit, remove-background, transcribe, video)
  • runpod - Runpod API (generate, edit)
  • ai-gateway - Vercel AI Gateway (generate, edit)

Provider Selection

  1. Explicit: --provider <name>
  2. Auto-detect from environment variables
  3. Fallback to local provider

Environment Variables

  • AGENT_MEDIA_DIR - Custom output directory
  • FAL_API_KEY - Enable fal provider
  • REPLICATE_API_TOKEN - Enable replicate provider
  • RUNPOD_API_KEY - Enable runpod provider
  • AI_GATEWAY_API_KEY - Enable ai-gateway provider