agentsclimarketplace

Aitool iroiro

Skill Nu424/aitool-iroiro/skills/aitool-iroiro

OpenRouter API / Google GenAI API / OpenAI API経由でマルチモーダルAIタスクをCLIから実行するツール群 (aitool-iroiro) の使い方スキル。 画像生成・画像認識・動画理解・音声文字起こし・音声合成が必要なとき、または `aitool` コマンドを使うタスクが来たときは必ずこのスキルを参照すること。 具体的には「画像を編集して」「この動画を要約して」「この音声をテキストにして」「テキストを読み上げて」「画像を説明して」などのリクエストが対象。From its SKILL.md

Install
npx -y skills add Nu424/aitool-iroiro --skill aitool-iroiro

Assembled from the repository path, not quoted from the project. Check it against their README if it does not work.

2 things to look at

  • no licenseNo license file was found in the repository. Code published without one is not open source by default, so using it at work is a question for whoever answers licensing questions where you are.
  • 0 stars0 stars. Stars are a popularity signal and not a quality one, but at this level it is likely that nobody has read this closely except its author, and you would be relying on your own review.

SKILL.md

10.1 KB, ~3.4k tokens by cl100k_base, as published. Nobody here has run it

aitool-iroiro スキル

OpenRouter APIとGoogle GenAI API、OpenAI APIを使ったマルチモーダルAI CLIツール群。aitool コマンド1本で画像生成・画像認識・動画理解・文字起こし・タイムスタンプ付き文字起こし・音声合成を実行できる。

コマンドリファレンス

共通オプション(全コマンドで使用可能)

オプション説明デフォルト
--model TEXT使用モデルを上書き環境変数またはプログラム内定数
--api-key TEXTAPIキーを指定(動画理解はGoogle GenAI、タイムスタンプ付き文字起こしはOpenAI、それ以外はOpenRouter).env / 環境変数
--timeout FLOATHTTPタイムアウト(秒)120.0
--jsonメタ情報をJSON形式で標準出力に表示False
--verbose追加ステータスをstderrに表示False

generate-image — 画像生成

テキストプロンプトから画像生成(t2i)、または入力画像を編集(i2i)する。

aitool generate-image \
  --text "かわいい猫を追加してください" \
  --output ./output.png \
  [--image ./input.png] \   # 省略するとt2i、指定するとi2i
  [--aspect-ratio 1:1] \
  [--image-size 1K]
オプション短縮必須説明
--text TEXT-tプロンプトテキスト
--output PATH-o生成画像の保存先パス
--image PATH-i入力画像パス(複数回指定可)
--aspect-ratio TEXTアスペクト比(例: 1:1, 16:9
--image-size TEXT画像サイズ(例: 1K, 2K, 4K
+ 共通オプション

--json 出力のキー: output, model, mime, message


recognize-image — 画像認識

画像に対してテキストで質問し、回答を得る。

aitool recognize-image \
  --text "この画像を説明してください" \
  --image ./photo.png \
  [--output ./result.txt]  # 省略すると標準出力
オプション短縮必須説明
--text TEXT-tプロンプトテキスト
--image PATH-i入力画像パス(複数回指定可)
--output PATH-oテキスト結果の保存先(省略→標準出力)
+ 共通オプション

--json 出力のキー: output, model


recognize-video — 動画理解

ローカル動画または公開YouTube URLに対してテキストで質問し、回答を得る。ローカル動画はGoogle GenAIのFile APIでアップロードしてから処理する。

aitool recognize-video \
  --text "この動画を要約してください" \
  --video ./meeting.mp4 \
  [--output ./result.txt]

aitool recognize-video \
  --text "章立てして、重要な発言を抽出してください" \
  --video "https://www.youtube.com/watch?v=..." \
  --fps 0.5 \
  --structured-output \
  --output ./video-analysis.json
オプション短縮必須説明
--text TEXT-tプロンプトテキスト
--video TEXT-v入力動画パス、または公開YouTube URL
--output PATH-oテキスト/JSON結果の保存先(省略→標準出力)
--structured-output組み込み動画分析スキーマに沿ったJSONを出力
--fps FLOAT動画サンプリングのカスタムフレームレート
+ 共通オプション

--json 出力のキー: output, model, structured_output, fps

注意: YouTube URLは公開動画のみ対応。動画理解ではGEMINI_API_KEYを使用する。


transcribe — 音声文字起こし

音声ファイルをテキストに変換する。

# STT専用APIを使う(デフォルト)
aitool transcribe --audio ./voice.mp3 [--output ./transcript.txt]

# マルチモーダルLLMに処理させる(プロンプト付き)
aitool transcribe \
  --mode llm \
  --prompt "話者ごとに分けてください" \
  --audio ./meeting.mp3
オプション短縮必須説明
--audio PATH-a入力音声ファイルパス
--output PATH-oテキスト結果の保存先(省略→標準出力)
--format TEXT音声フォーマット(省略→拡張子から推定)
--mode TEXTdedicated(デフォルト)または llm
--prompt TEXT--mode llm 使用時のプロンプト
+ 共通オプション

--json 出力のキー: output, model, mode


transcribe-timestamp — タイムスタンプ付き文字起こし

OpenAI 公式 API を直接呼び出し、segment(または word)単位のタイムスタンプ付き文字起こしを行う。結果は verbose_json 形式の JSON。

# セグメント単位(デフォルト)
aitool transcribe-timestamp --audio ./voice.mp3 [--output ./transcript.json]

# 単語単位のタイムスタンプも含める
aitool transcribe-timestamp \
  --audio ./voice.mp3 \
  --granularity segment \
  --language ja \
  --output ./transcript.json
オプション短縮必須説明
--audio PATH-a入力音声ファイルパス
--output PATH-oJSON結果の保存先(省略→標準出力)
--format TEXT音声フォーマット(省略→拡張子から推定)
--granularity TEXTsegment(デフォルト)、wordboth
--language TEXT入力言語の ISO-639-1 コード
--prompt TEXTスタイル誘導用プロンプト
+ 共通オプション(--json 除く)

注意: OPENAI_API_KEY が必要。既定モデルは whisper-1(25MB まで)。gpt-4o-transcribe 系は verbose_json 非対応のため使用不可。


tts — 音声合成

テキストから音声ファイルを生成する。

aitool tts \
  --text "こんにちは。テストです。" \
  --output ./voice.mp3 \
  [--voice alloy] \
  [--format mp3] \
  [--speed 1.0]
オプション短縮必須説明
--text TEXT-t合成するテキスト
--output PATH-o音声ファイルの保存先パス
--voice TEXTボイス識別子(デフォルト: alloy
--format TEXT出力音声フォーマット(デフォルト: mp3
--speed FLOAT再生速度(モデルが対応している場合)
+ 共通オプション

--json 出力のキー: output, model, content_type, generation_id


困ったときは

aitool: command not found — 未インストールの場合

インストールせずに一時実行する:

uvx --from git+https://github.com/Nu424/aitool-iroiro.git aitool <サブコマンド> [オプション]

または恒久インストール:

uv tool install git+https://github.com/Nu424/aitool-iroiro.git

Error: OPENROUTER_API_KEY not found — OpenRouter APIキー未設定の場合

ユーザーに以下のいずれかを案内する:

A. カレントディレクトリに .env を作る(推奨):

OPENROUTER_API_KEY=sk-or-xxxxxxxxxxxxxxxx

B. ホームの ~/.env.global に書く(グローバル設定):

OPENROUTER_API_KEY=sk-or-xxxxxxxxxxxxxxxx

C. CLI引数で直接渡す(一時的な使用):

aitool generate-image --api-key sk-or-xxx --text "..." --output ./out.png

APIキーは https://openrouter.ai/keys で取得できる。

Error: GEMINI_API_KEY not found — Google GenAI APIキー未設定の場合

動画理解を使う場合は、以下のいずれかでGoogle GenAI APIキーを設定する:

GEMINI_API_KEY=xxxxxxxxxxxxxxxx

またはCLI引数で直接渡す:

aitool recognize-video --api-key xxxxx --text "要約して" --video ./video.mp4

Error: OPENAI_API_KEY not found — OpenAI APIキー未設定の場合

タイムスタンプ付き文字起こしを使う場合は、以下のいずれかで OpenAI API キーを設定する:

OPENAI_API_KEY=sk-xxxxxxxxxxxxxxxx

またはCLI引数で直接渡す:

aitool transcribe-timestamp --api-key sk-xxx --audio ./voice.mp3

APIキーは https://platform.openai.com/api-keys で取得できる。


参考: API キー・モデルの設定

APIキーとモデルは以下の優先順で解決される(上ほど優先)。

優先度方法
1--api-key CLI引数
2カレントディレクトリの .env
3~/.env.global
4環境変数

.env の例:

OPENROUTER_API_KEY=sk-or-...
GEMINI_API_KEY=...
OPENAI_API_KEY=sk-...

# モデルを変えたい場合(省略時はプログラム内定数が使われる)
AITOOL_IMAGE_GENERATION_MODEL=google/gemini-3.1-flash-image-preview
AITOOL_IMAGE_RECOGNITION_MODEL=google/gemini-3-flash-preview
AITOOL_STT_MODEL=openai/whisper-large-v3-turbo
AITOOL_STT_TIMESTAMP_MODEL=whisper-1
AITOOL_TTS_MODEL=google/gemini-3.1-flash-tts-preview
AITOOL_VIDEO_RECOGNITION_MODEL=gemini-3.5-flash

What ships with it

Read from the repository

Just SKILL.md. No reference files, no scripts.

Keep looking

Skills are one crate of 326,149. Ordering is by how many stacks a row turns up in, so the top of any crate is what has actually been picked rather than what has the most stars.