🛠️ メイキング・オブ・統計小噺
みなさんも生成AIを活用して、統計・データ分析の記事を書いてみませんか?
イントロ
今回は、日常と統計を結ぶ 統計小話シリーズ記事の 制作過程 に焦点を当てます。
統計小噺シリーズの記事のほとんどは ChatGPT とのチャットで作られています。
私は ChatGPT の指示を受けて、データを取得する係です(笑)
この記事では、比較的 罵詈雑言が少ない スムーズに進行したこちらの記事(統計小噺第4話)の記事制作過程を紹介いたします。
統計小噺第4話ができるまで
テーマ検討
第3話の原稿完成を迎えて、次のテーマ探しから珍道中は始まります。
すでに記事フォーマットや検討ステップをChatGPTと共有できており、
テーマ決定 ⇒ シナリオ検討 ⇒ 原稿作成
を楽々と進めるはずだったのですが…









シナリオの裏付けになるデータの確認
記事シナリオの裏付けになる統計データの確認はとても大切な工程です。
なぜならば…
ChatGPTは世の中に存在しない架空データを造り込みますから…
(ChatGPTが生成したシナリオ仮説に都合の良いデータをでっち上げ…)
ちなみに、ChatGPTは政府統計の総合窓口 e-Stat からデータをダウンロードできないようなので、私がダウンロードする係になっています。













データの深堀り
ChatGPTから指示されたデータを e-Stat でダウンロードして、チャット画面を通じて ChatGPTにアップロードしました。
続いて、データの中身を調べて、シナリオ・仮説と整合するかどうかをチェックします。
ものすごく忍耐力を必要とする作業です。







ChatGPTが実際のデータと異なることを言ってきまして…
データに関する明確な指示をChatGPTに出します。







ChatGPTのデータ処理は(人間側の指示が曖昧なせいもあり)、精度が低いことが多いです。
つぶさにChatGPTのデータ処理内容をチェックする必要があります。
(自分でデータ処理する方が早いかもしれません…)





















なんということでしょう。データ処理精度が悪いです。
ここはChatGPTに頑張ってもらいましょう。
(データ管理スペシャリストって言いたかっただけ)









ChatGPTのコードを改造して、私が欲しいデータを取得できるようにします。







記事シナリオの検討
データが揃ったところで、記事シナリオの検討に移ります。
ChatGPTが作るグラフや要約数値とシナリオを見比べて、試行錯誤でシナリオを固めます。


















ChatGPTのPythonコードを自PCで動かして、コードを改善しつつ、グラフを作ります。
データの種類・切り口が多くて記事が複雑になりそうだと、気づきました。


















記事ドラフトを確認して、主張・データの裏付け・ボリューム感が整った印象を受けました。
シナリオの大枠がまとまったところで、Pythonのグラフ作画コードを私の方で最終化します。
記事の検討
記事をつくりこみます!
いい記事に到達できるよう、祈るように作業します。



ChatGPT生成の原稿に目を通して、私の方で修正を入れて、ChatGPTにフィードバックします。





整った文章になりましたが、中身は面白くありません…
そこであのスパイスを投入します。










粗雑さは残るものの、面白みが出てきました。
ニュースと記事の参照内容の整合性を確認しておきます。
次の難関は「統計的な深堀り部分」の検討です。
適度な統計指標を見つけるのにいつも苦労しています。



















なんとか「記事のベース」が出来上がりました。
原稿完成へ
ここから私の個人作業が始まります。
ChatGPT生成の記事たたき台を使って、気になる部分を直していきます。
あわせて、グラフやMann-Kendall検定のPythonコードを記事に添えられるレベルに仕上げます。


こんな感じで統計小噺が生まれます。
いつも、裏付けデータを作り込む作業で心身を消耗してしまいます…
ChatGPTのデータ処理精度を上げていきたいです。
おわり
シリーズ記事
次の記事
前の記事
目次
ブログの紹介
note で8つのシリーズ記事を書いています。
ぜひ覗いていってくださいね!
1.のんびり統計
統計検定2級の問題集を手がかりにして、確率・統計をざっくり掘り下げるブログです。
雑談感覚で大丈夫です。ぜひ覗いていってくださいね。
統計検定2級公式問題集CBT対応版に対応しています。
Python、EXCELのサンプルコードの配布もあります。
2.統計・データ分析とつながる
シリーズ「統計・データ分析とつながる」は、統計・データ分析との「つながり」を発掘して、コラム風に仕立てたブログシリーズです。
生成 AI の力を借りながら、統計・データ分析の入り口をイメージして、自由気ままに書きました。
たとえば…
・日常生活と統計のつながり
・統計検定2級からその先へのつながり
気楽にお読みいただけたら嬉しいです🍀
3.実験!たのしいベイズモデリング1&2をPyMC Ver.5で
書籍「たのしいベイズモデリング」・「たのしいベイズモデリング2」の心理学研究に用いられたベイズモデルを PyMC Ver.5で描いて分析します。
この書籍をはじめ、多くのベイズモデルは R言語+Stanで書かれています。
PyMCの可能性を探り出し、手軽にベイズモデリングを実践できるように努めます。
身近なテーマ、イメージしやすいテーマですので、ぜひぜひPyMCで動かして、一緒に楽しみましょう!
4.実験!岩波データサイエンス1のベイズモデリングをPyMC Ver.5で
書籍「実験!岩波データサイエンスvol.1」の4人のベイジアンによるベイズモデルを PyMC Ver.5で描いて分析します。
この書籍はベイズプログラミングのイロハをざっくりと学ぶことができる良書です。
楽しくPyMCモデルを動かして、ベイズと仲良しになれた気がします。
みなさんもぜひぜひPyMCで動かして、一緒に遊んで学びましょう!
5.楽しい写経 ベイズ・Python等
ベイズ、Python、その他の「書籍の写経活動」の成果をブログにします。
主にPythonへの翻訳に取り組んでいます。
写経に取り組むお仲間さんのサンプルコードになれば幸いです🍀
6.RとStanではじめる心理学のための時系列分析入門 を PythonとPyMC Ver.5 で
書籍「RとStanではじめる心理学のための時系列分析入門」の時系列分析をPythonとPyMC Ver.5 で実践します。
この書籍には時系列分析のテーマが盛りだくさん!
時系列分析の懐の深さを実感いたしました。
大好きなPythonで楽しく時系列分析を学びます。
7.データサイエンスっぽいことを綴る
統計、データ分析、AI、機械学習、Pythonのコラムを不定期に綴っています。
統計・データサイエンス書籍にまつわる記事が多いです。
「統計」「Python」「数学とPython」「R」のシリーズが生まれています。
8.Python機械学習プログラミング実践記
書籍「Python機械学習プログラミング PyTorch & scikit-learn編」を学んだときのさまざまな思いを記事にしました。
この書籍は、scikit-learnとPyTorchの教科書です。
よかったらぜひ、お試しくださいませ。
最後までお読みいただきまして、ありがとうございました。
いいなと思ったら応援しよう!
応援ありがとうございます。これからもがんばって記事を作成します!