LLM・生成AI
トークンとは?
トークンとは、LLMが文章を処理するために分割する単位です。単語、文字、単語の一部などになります。
関連表記: トークン / Token / トークナイザー / Tokenizer / トークン化
試験で問われるポイント
- 入力長や出力長はトークン数で制限されることがあります。
- 日本語では文字数とトークン数が一致しない場合があります。
- 料金や処理可能な文脈量にも関係します。
具体例
長い議事録を投入すると、コンテキストウィンドウの上限に達することがあります。
混同しやすい点
- 1トークンは必ず1単語だと考える。
- 文字数だけ見ればLLMの処理量が分かると考える。
関連問題で復習
OAuth 2.0で保護されたREST APIを呼び出す際、クライアントが取得したトークンの扱いとして最も適切なものはどれか。
Amazon Bedrockの基盤モデルを利用するアプリの月額費用を抑えたい担当者が、課金の仕組みを理解しようとしています。多くの生成AIサービスにおけるトークンベース課金の説明として最も適切なものはどれか。
生成AIが長い会話履歴を毎回読み込んでおり、入力トークンの費用が増えています。必要な情報を保ちながら入力を削減する方法として適切なのはどれですか。
商品名の完全一致検索に使う正規化済みトークンを ai model 2026 にそろえたい。元の文字列と処理候補から、最も適切なものはどれか。 ```text 元の文字列: AI-Model 2026!! ```
可変長文を扱うTransformerで、各トークンの隠れ特徴をそのトークン内でまとめて正規化し、バッチ内の他の文には依存させたくない。候補として最も適切なのは[ A ]である。
画像を作る二つの方式について、Aはノイズを少しずつ取り除いて画像へ近づけ、Bは既に生成した部分を条件に次の画像トークンを順に予測する。代表的な方式の対応として正しいものはどれか。
同じ入力から表現の異なる広告案を得たいので、温度パラメータを高くしました。この変更について最も適切な説明はどれですか。
複数のエージェントアプリから社内の検索機能や業務ツールへ接続したいと考えています。Model Context Protocol(MCP)が担う役割として最も適切なのはどれですか。