「あああ いいい ううう」が0.604。ベクトル検索の点数は、なぜ0にならないのか
意味のない文字列が、意味のある無関係な質問より高い類似度を出し、しきい値を突破しました。なぜそうなるのかを768次元の実測で分解し、対処まで書きます。
意味のない文字列が、意味のある無関係な質問より高い類似度を出し、しきい値を突破しました。なぜそうなるのかを768次元の実測で分解し、対処まで書きます。
AIのAPI利用料は「使った分だけ」。日本語は英語の2倍以上トークンを使うという実測値から、社内問い合わせボットの月額を具体的に計算し、稟議に書ける予算の組み方まで整理します。
「すもももももももものうち」はどこで切れるのか。形態素解析がやっている3つの仕事(分かち書き・品詞判定・原形化)と、MeCab/Sudachi/Janomeの使い分け、結果を左右する辞書の選び方を、Pythonの実例つきで解説します。
もうひとつの選択肢 / 自前構成 専用サービスを使わず、既存のPostgreSQ… 続きを読む »【前編】DjangoからAWS Bedrock Knowledge Bases (RAG) を呼び出す実装例
はじめに 日本語のテキスト処理技術が急速に進化している現代。中でも、LINE が… 続きを読む »LINEの大規模言語もモデルでネット記事がちゃんと書けるのか?japanese-large-lm-3.6b