実際にあった相談——記録データを顧客ごとに自動でひも付けたい
ご相談いただいたのは、オンラインでサービスを提供している会社です。日々発生する記録データ(ファイル名に顧客名が入る運用)を、顧客管理システムの各顧客レコードへ自動でひも付けたい、というご依頼でした。名簿の登録は約2,000名。毎晩の自動処理で、名前を手がかりに照合する設計です。
仕組み自体は問題なく動きました。ところが運用を始めると、照合できずに残るデータが20件以上発生しました。調べると、原因はプログラムではなく、すべて「名前の書かれ方」でした。ご担当者も「こんなに表記が揃っていないとは」と驚かれていました。
照合を外した4つの原因——どの会社の名簿にも潜んでいる
実際に照合を外した原因は、次の4パターンに整理できました。
- 1. 名前以外の文字の混入:名簿側の名前に管理用の記号や区分コードが付いている(「A 山田太郎」のような形式)。ファイル側には当然その記号がない
- 2. 全角・半角と空白のゆれ:姓と名の間の空白が全角・半角・なしで混在。英数字の全半角も揃っていない
- 3. 異体字と誤記:「凛」と「凜」、「髙」と「高」、「﨑」と「崎」の異体字に加え、「朗」を「郎」、「太」を「汰」と入力した純粋な誤記
- 4. ひらがな表記と名前なし:ファイル側が「やまだ はなこ」のようにひらがなで、名簿側は漢字。そもそも名前が入力されていないデータもあった
重要なのは、1と2は機械で吸収できるが、3と4の一部は吸収できないという線引きです。異体字は変換表で寄せられますが、「朗と郎」は本当に別人の可能性があるため、機械が勝手に同一人物と断定するのは危険です。実際この名簿には、読みがまったく同じ別人が4組いました。
この構図は、請求先名の突合、勤怠データと従業員名簿の照合、データ入力の自動化など、名前をキーにするあらゆる連携で発生します。
事故を防いだ設計——「迷ったら書かない」
この案件で最も重視したのは、照合率を上げることではなく、誤った顧客のレコードにデータを書き込まないことです。設計は次の3層にしました。
第1層:機械で安全に吸収できるゆれは正規化する
全角・半角、空白の有無、管理記号の除去、異体字の変換表、ひらがな・カタカナの読みでの照合——ここまでは機械の仕事です。読みでの照合には、名簿側にあったフリガナ項目が決め手になりました。フリガナ欄が整備されている名簿は、それだけで連携の成功率が大きく変わります。
第2層:候補が1人に絞れなければ書き込まない
正規化しても候補が2人以上残る場合、システムは書き込みを止めて「未処理一覧」に回します。読みが同じ別人がいる以上、「たぶんこの人」で書き込む設計は、運用が長くなるほど誤登録の確率が積み上がります。書き込まなければ、翌日に人が確認して直せます。誤って書き込めば、気づくまで間違ったデータが顧客対応に使われ続けます。この非対称性が判断の根拠です。
第3層:表記ゆれの記録を自動で残し、発生源を直す
照合はできたが表記が揺れていたケース(異体字・ひらがな)は、「表記ゆれ一覧」として毎晩自動で記録するようにしました。ご担当者はこの一覧を使って、入力したスタッフに正しい表記を案内できます。ゆれを吸収して終わりにせず、発生源の入力ルールを直すことで、ゆれ自体が減っていきます。運用の結果、20件以上あった未処理は数件まで減りました。副産物として、名簿側に同一人物の重複登録が10組以上見つかり、名簿の整理にもつながりました。
自社でできる表記ゆれ対策——連携を考える前の3手順
システム連携の予定がなくても、次の3つは今日から着手できます。将来の自動化の成功率を大きく左右します。
- 手順1:入力ルールを1枚に決める——姓名の間は全角空白1つ、英数字は半角、記号や区分は名前欄に入れず専用の列へ。ルールがないことが、ゆれの最大の発生源
- 手順2:フリガナ欄を必須にする——漢字の異体字・誤記があっても、読みが合っていれば照合の最後の砦になる
- 手順3:自由入力をやめて選択式にする——名前を毎回手入力するのではなく、名簿から選ぶ形式に変える。現場入力をフォームで自動化すると、入力の時点でゆれが発生しなくなる
転記そのものを減らす考え方は転記ミスを仕組みで防ぐ方法でも解説しています。
費用相場と外注時の確認ポイント
名前照合を含むシステム連携は、弊社の経験では小規模なもので5万円前後から、毎晩の自動実行・照合の例外処理・運用レポートまで含めると10万円前後からが相場です。継続的な表記ゆれ対応を保守(月1万円前後〜)に含める形も一般的です。
外注する場合は、見積もり時に次の2つを確認してください。「照合できなかったデータはどうなりますか」と「別人に誤って書き込まない仕組みはありますか」です。この2つに具体的な答えがない提案は、正常系しか設計されていない可能性があります。自動化の失敗パターン全般はRPA失敗事例5選と回避の3原則にまとめています。
「連携できるか・どこで詰まるか」を、AIに30秒で診断
つなげたいシステムと業務を1行入力するだけ。照合の詰まりどころまで含めた自動化案を、その場でお見せします。月額3万円〜・最短2週間で運用開始。
AIに30秒で試す →よくある質問
Q. 表記ゆれはAIに任せれば全部解決できませんか?
部分的には有効ですが、任せきりは危険です。AIは「凛と凜は同一人物の可能性が高い」といった推定は得意ですが、読みが同じ別人を確実に区別することはできません。推定で書き込む設計にすると、誤登録に気づけなくなります。機械で確実に判断できる範囲は自動化し、確実でないものは人の確認に回す二段構えが実用的です。
Q. 既存の名簿が既にゆれだらけです。連携の前に全部直すべきですか?
全部直す必要はありません。実案件でも、まず連携を動かし、照合できなかったものと表記が揺れていたものを一覧で自動記録する形にしました。一覧に出てきたものから直せば、実際に使われているデータだけを効率よく整備できます。先に全件クレンジングを行うと、使われていないデータの整備に時間を使ってしまいがちです。
Q. 顧客番号で照合すれば表記ゆれ問題は起きないのでは?
そのとおりで、番号などの一意なキーで照合できるならそれが最善です。問題は、現場で発生するデータ(ファイル名・手書き帳票・フォーム入力など)に顧客番号が付いていないケースが多いことです。その場合は名前照合に頼らざるを得ないため、本記事の対策が必要になります。長期的には、データの発生時点で番号を付与する運用への移行をおすすめします。
