メインコンテンツへ
木村 優介
目次
言語: 日本語

国内研究会

ByteTop-k OPD: バイト列表現に基づく語彙の異なる LLM 間のオンポリシ蒸留

木村 優介, 駒水 孝裕, 波多野 賢治, 石川 佳治

情報処理学会研究報告 2026-NL-269

要旨

オンポリシ蒸留は生徒モデル自身が生成した文脈上で教師モデルの予測を学習する手法だが,教師と生徒の語彙が異なる場合には次トークン分布を直接比較できない.既存手法は両モデルの語彙に共通して現れるトークンや,生成文中で文字列として対応づくまとまりに比較対象を限っており,生徒モデルの有力候補であっても比較対象から外れることがある.本稿では,生徒分布の上位 k 候補をバイト列として表現し,これを教師モデルの語彙上で実現しうるトークン列に対応づけることで共通の比較ラベルを構成する ByteTop-k OPD を提案する.

BibTeX

@inproceedings{kimura20264tofs9,
  title     = {ByteTop-k OPD: バイト列表現に基づく語彙の異なる LLM 間のオンポリシ蒸留},
  author    = {木村 優介 and 駒水 孝裕 and 波多野 賢治 and 石川 佳治},
  booktitle = {IPSJ SIG-NL Technical Report 2026-NL-269},
  year      = {2026},
  month     = {9},
}