多式漢字検索 (Kanji Search Using Multiple Methods)

多式漢字検索

従来の漢字検索法は、図書ベースのため、「1対多」の漢字検索で、部首、読み、画数だけを指定して、漢字を検索する方式が主でした。

しかし、Webアプリケーションの漢字検索では、データベース(Database)と検索言語SQLを使用することにより、「多対多」や「部分一致」の漢字検索が可能となりました。

前回の投稿で書いた「EDRDG漢字辞書」には、JIS第一水準と第二水準の約6,355個の漢字が含まれています。
我々は、この漢字辞書を利用して、10種類の方式で、漢字を探す「多式漢字検索法 (Kanji Search Using Multiple Methods) 」を公開しています。

漢字検索時の暗黙範囲指定は、「常用漢字」となっていますが、「小学校」の教育漢字に検索範囲を指定することにより、検索時間を少し早くすることができます。

なお、一般の学習者ばかりでなく、補修校、継承日本語教育、海外子育て、海外にルーツを持つ人などの漢字学習ツールとしても、ぜひ、お試しいただければ幸いです。

特に、この多式漢字検索は、低料金のサーバで運用しており、最近、検索ロボットからのアクセスが増加しており、サーバ負荷により、検索時間が多くかかることあることを、あらかじめご了承をお願いします。また、サーバ強化やスケールアップにご支援いただければ幸いです。


実際には、1. ひらがな・カタカナ・ローマ字の読み、2. 英語と日本語の意味、3. 部首、4. ピン音と声調、5. Skip Codes、6. Four Corner Codes、 7. 手書き漢字認識 (2008年)、8. 字素(じそ)系列 (2020年)、 9. 声符(せいふ) (2020年)、10. 画素(かくそ)系列(けいれつ) (2021年)を用いた漢字検索が可能です。

ただし、1. 読み検索において、ひらがなとカタカナの1文字だけは、検索できないので、例えば、「き」では「ki」とローマ字入力をする必要があります。

字素系列漢字検索

さて、8番目の字素系列 (grapheme sequence)漢字検索では、部首を知らなくても、字素系列で漢字を検索することができます。

例えば、小学校漢字で、「冂二十十」(順序任意)を指定して検索すると、下の図1の例のように、10個 (時, 朝, 植, 軽, 積, 博, 構, 幹, 精, 潮)が 見みつかります。なお、この表示される漢字の順は、使用頻度の高いものから表示されます。また、この結果をよく考察すると、「龶=十+二」のような字素分解の学習にもつながる事になります。

図1 「冂二十十」の字素系列による多式漢字検索の例(一部)

声符漢字検索

また、9番目の声符 (homophone components)漢字検索において、「寺」では、声符「」(じ)を含む全ての漢字として、10個 (塒, 時, 寺, 持, 侍, 蒔, 峙, 恃, 畤, 痔)が見みつかります。
また、「九」(きゅう)では、声符「九」を含む全ての 漢字として、4個(鳩, 九, 究, 仇)が見つかります。

このように、早くから「声符」に気が付かせる漢字学習指導を行うと、Kaiser Stefan先生の言われるように、「漢字の増幅作用」により、漢字学習を楽しく感じることができます。

画素部分系列漢字検索

さらに、10番目の画素部分系列(partial sequence of atoms)漢字検索は、常用漢字までの検索範囲で利用できます。
例えば、「三氺」の画素部分系列「→→→↓↘↗↙↘」を含む常用漢字として、3個 (球, 様, 摂)が見つかります。これより、「様」の縦画は1画であることにも気づきます。

また、「成」など画連結した漢字を、「↙→.↘↙↘1」ののようにドットのワイルドカード、画素最後位置指定1、および、画素部分系列で検索することができます。

従来、漢字の「書き順」を覚えても、何の役にも立たないと言われてきましたが、このように、画素部分系列により漢字を検索できるとなると、書き順の暗記は、非常に重要となります。

以上、多式漢字検索法について書きました。
次回は、7番目の「教育用手書き漢字認識」について投稿します。

いいなと思ったら応援しよう!

Kanji Science ありがとうございます。いただいたチップは、漢字認識サーバのスケールアップや運用費用の一部として利用させていただきます。