Paper Overview
論文の概要
本考察は、AIを人間の価値へ整合させる議論の背後に、価値は固定可能であり、制御主体はその外側に立てるという形而上学的前提が潜んでいないかを問います。そのうえで、価値を歴史と関係の中で形成されるものとして扱い、判断の前提、応答、逸脱、訂正、採用理由を未来から問い直せる「Chronicle」の必要性を提示します。
価値固定の前提を問う
AIアラインメントが、人間の価値を事前に抽出・固定できる対象として扱うとき、価値が歴史や関係の中で更新される過程が見えにくくなることを検討します。
制御の来歴を開く
制御そのものを否定するのではなく、誰が、どの前提と責任で制約を設計し、異議申立てや更新を可能にするのかを、追跡可能な来歴として扱います。
継続性を安全性へ含める
安全性を単一時点の適合だけで捉えず、応答、逸脱、訂正、修復を経ても、人とAIが意味形成を続けられる条件へ拡張します。
支援内容を見る