Docker-Compose

AnyGPTをDockerで簡単に実行する方法

はじめにAnyGPTは、音声、テキスト、画像、音楽など様々なモダリティを統一的に処理できるマルチモーダル言語モデルです。この記事では、Dockerを使ってAnyGPTを簡単に実行する方法を初心者向けに解説します。AnyGPTとはAnyGPT...

2024.03.27

LLM

はじめにHarinaはDiscordで動作するレシート解析Botです。ユーザーがチャットにレシートの画像を送信すると、最新のClaude 3 Haikuモデルを使って高速かつ高精度にレシートの情報を抽出します。抽出されたデータはGoogle...

2024.03.27

AI

はじめにLiteLLM Proxyは、100以上のLarge Language Models (LLMs)を統一されたインターフェースで呼び出すことができるプロキシサーバーです。仮想キーやユーザーごとに支出を追跡し、予算を設定する機能も備え...

2024.03.19

LLM

LiteLLMは、OpenAI形式を使用してすべてのLLM APIを呼び出すことができるツールです。このガイドでは、初心者でも理解できるように、LiteLLMをDockerを使用してセットアップする方法を丁寧に説明します。こちらの記事もおす...

2024.03.19

LLM

要旨（Abstract）この論文では、MusicHiFiという新しい高速かつ高品質なステレオボーコーディング手法を提案しています。MusicHiFiは、低解像度の音声表現（メルスペクトログラムなど）から音声を生成し、位相再構成モデルやボーコ...

2024.03.18

AI

こちらの記事もおすすめYlvaVisionAPIYlvaVisionAPIは、Webカメラからリアルタイムの画像を取得し、ブロードキャストするためのAPIです。このREADMEでは、APIの機能、セットアップ方法、使用方法について説明します...

2024.03.11

claude

Style-Bert-VITS2は、音声合成モデルの一つで、カクテルストア音声に似た自然な音声を生成できるモデルです。この記事では、Dockerを使ってStyle-Bert-VITS2を構築する方法を丁寧に解説します。こちらの記事もおすすめ...

2024.03.09

AI実況

Langchainは、言語モデルを活用したアプリケーション開発のためのフレームワークです。この記事では、Langchainを使ってGoogleのGenerative AIモデルを効果的に使用する方法を、初心者にも分かりやすく解説します。La...

2024.03.03

Gemini

Deepgramは、最先端の音声認識技術を提供するプラットフォームです。この記事では、Deepgramを使ってマイクからの音声をリアルタイムで文字に変換する方法を、初心者にも分かるように解説します。Pythonを使ったシンプルなスクリプトを...

2024.03.02

AI実況

最近、Windowsで動作するOllama for Windows (Preview)を使って、Local RAG（Retrieval Augmented Generation）を体験してみました。この記事では、そのプロセスと私の体験をステ...

2024.02.29

LLM