← Về thư mục
📄 / / root / ceo / projects / tech / TypeWhisper_OpenProxy / README.md

TypeWhisper_OpenProxy

Cập nhật lần cuối / Last updated: 2026-06-30 (GMT+7)

TypeWhisper_OpenProxy là một giải pháp tích hợp dịch vụ chạy ngầm gọn nhẹ, đóng vai trò làm cổng kết nối (Proxy) giữa ứng dụng TypeWhisper Desktop và các công cụ dịch thuật hàng đầu: 1. ASR Đám mây (Alibaba Cloud / DashScope): Cho tốc độ cực nhanh và nhận diện chính xác cao. 2. ASR Ngoại tuyến (Local Offline): Sử dụng mô hình tiếng Việt cục bộ chạy hoàn toàn trên CPU/GPU của máy tính, không gửi dữ liệu ra ngoài Internet. 3. LLM Refinement (Gemini / Qwen / Gemma): Tự động sửa lỗi chính tả, xóa từ đệm và tóm tắt cuộc họp theo các cấu trúc chuyên nghiệp. 4. Quy trình Tự động hóa 1-Click: Tự động lấy file ghi âm mới nhất từ Voice Memos, dịch băng, làm sạch bằng AI và đẩy thẳng vào Obsidian.


Để đạt hiệu quả tối ưu về cả tốc độ lẫn chất lượng, bạn nên lựa chọn mô hình theo bảng khuyến nghị dưới đây:

Tác vụ (Use Case) Mô hình Khuyến nghị Loại (Cloud/Local) Ghi chú
Nhận dạng Tiếng Việt
(ASR Vietnamese)
qwen3-asr-flash (Ưu tiên)
local-zipformer-vi-68m
Đám mây (Alibaba)
Ngoại tuyến (Local)
Mô hình Qwen3 dịch siêu tốc.
Mô hình 68M chạy offline tốt nhất.
Nhận dạng Quốc tế
(ASR International)
qwen3.5-omni-flash (Ưu tiên)
fun-asr-mtl
Đám mây (Alibaba)
Đám mây (Alibaba)*
Nhận dạng đa ngôn ngữ cực tốt.
*Lưu ý: FunASR chạy qua dịch vụ Cloud của Alibaba.
Làm sạch & Tóm tắt
(LLM Refinement)
gemini-2.5-flash (Ưu tiên)
gemma4:e2b
Đám mây (Google API)
Đám mây (Alibaba)
Gemini có context dài, viết tóm tắt xuất sắc.
Gemma chạy trực tiếp qua API đám mây.

⚙️ Hướng dẫn Cấu hình trên Giao diện App TypeWhisper (App UI Setup)

[!NOTE] Tại sao cần dùng dịch vụ Proxy này? Mặc định, cổng kết nối OpenAI Compatible của ứng dụng TypeWhisper gốc không hỗ trợ các mô hình tùy chỉnh bên ngoài (như mô hình tiếng Việt local-zipformer-vi-68m hoặc qwen3-asr-flash).

Để vượt qua giới hạn này, dự án của chúng ta tạo ra một Cổng kết nối trung gian (Proxy Gate) chạy tại địa chỉ http://127.0.0.1:8001. Khi bạn gửi yêu cầu dịch thuật từ app TypeWhisper, proxy này sẽ chặn lại, tự động xử lý (nếu chọn mô hình cục bộ) hoặc chuyển tiếp lên đám mây thích hợp, giúp bạn thoải mái tải và sử dụng bất kỳ mô hình nào tùy ý.

Các bước thiết lập trên App:

  1. Mở ứng dụng TypeWhisper trên máy tính của bạn.
  2. Vào phần Cài đặt (Settings) > API Keys / Providers.
  3. Thêm hoặc chọn mục OpenAI Compatible:
  4. Base URL: Nhập http://127.0.0.1:8001/v1
  5. API Key: Nhập một chuỗi ký tự bất kỳ (hoặc dán API Key Gemini của bạn để script tự động sử dụng).
  6. Nhấn Làm mới (Refresh) ở danh sách mô hình của ứng dụng. Bạn sẽ thấy các mô hình mới xuất hiện:
  7. Mô hình Cloud: qwen3-asr-flash, qwen3.5-omni-flash, fun-asr-mtl.
  8. Mô hình Local: local-zipformer-vi-68m, local-zipformer-vi-68m-punc, local-zipformer-vi-68m-punc-diar (kèm các tùy chọn số lượng người nói từ spk2 đến spk5 - đang trong quá trình thử nghiệm).

🍎 Hướng dẫn Cài đặt trên macOS (macOS Setup)

Dịch vụ hỗ trợ tối ưu riêng cho dòng chip Apple Silicon (M1/M2/M3/M4).

Bước 1: Chuẩn bị môi trường & Ứng dụng khách

  1. Tải và cài đặt ứng dụng TypeWhisper cho macOS tại github.com/TypeWhisper/typewhisper-mac.
  2. Mở Terminal và clone kho lưu trữ của bạn: bash git clone <link_repository_cua_ban> cd typewhisper-openproxy

Bước 2: Khởi tạo môi trường ảo Python & Ffmpeg

Chạy script cài đặt tự động (không cần cài Homebrew):

chmod +x install.sh && ./install.sh

Script sẽ tự động tải phiên bản ffmpeg tĩnh phù hợp, tạo môi trường ảo venv, cài đặt các thư viện cần thiết và đăng ký dịch vụ chạy ngầm com.typewhisper.nhi tự khởi động cùng máy Mac.

Bước 3: Tải các mô hình AI ngoại tuyến (Local Models)

Để chạy nhận diện offline mà không cần tải thủ công từ trình duyệt, bạn chạy lệnh sau trong Terminal:

./venv/bin/python3 download_models.py

[!NOTE] Lệnh này làm gì?: Lệnh này sẽ chạy tập lệnh Python tự động tải xuống các mô hình AI cần thiết (bao gồm mô hình nhận diện giọng nói tiếng Việt chất lượng cao 68M và mô hình phân tách người nói) trực tiếp từ Hugging Face và lưu vào thư mục models/ trong máy của bạn.


🖥️ Hướng dẫn Cài đặt trên Windows (Windows Setup)

Mã nguồn dịch vụ proxy này hoàn toàn tương thích và chạy được trên hệ điều hành Windows 10/11. Do Windows không hỗ trợ các tập lệnh .sh và LaunchAgent của macOS, bạn hãy làm theo các bước sau:

Bước 1: Chuẩn bị môi trường

  1. Tải và cài đặt ứng dụng TypeWhisper cho Windows tại github.com/TypeWhisper/typewhisper-win.
  2. Cài đặt Python 3.10 hoặc 3.11 (chú ý tích chọn "Add Python to PATH" khi cài đặt).
  3. Cài đặt GitFFmpeg (tải FFmpeg cho Windows, giải nén và thêm thư mục bin của nó vào biến môi trường PATH của hệ thống).

Bước 2: Tải code và cài đặt thư viện

Mở Command Prompt (cmd) hoặc PowerShell và chạy các lệnh sau:

git clone <link_repository_cua_ban>
cd typewhisper-openproxy

:: Tạo môi trường ảo Python
python -m venv venv

:: Kích hoạt môi trường ảo và cài đặt thư viện
venv\Scripts\activate
pip install -r requirements.txt

Bước 3: Tải các mô hình AI ngoại tuyến (Local Models)

Chạy lệnh sau để tải tự động các mô hình AI về thư mục models/:

python download_models.py

Bước 4: Khởi chạy máy chủ

Mỗi khi muốn chạy dịch vụ proxy trên Windows, bạn mở cmd trong thư mục dự án và chạy:

venv\Scripts\python proxy.py

Dịch vụ sẽ chạy tại địa chỉ http://127.0.0.1:8001. Bạn có thể cấu hình app TypeWhisper kết nối tới cổng này bình thường.


🔄 Quy trình Tự động hóa: Ghi âm -> Obsidian (TypeWhisper Auto)

Bạn có thể cấu hình để chỉ với 1 tổ hợp phím tắt, hệ thống sẽ tự động quét file ghi âm mới nhất trong máy Mac, gọi API dịch băng, gọi AI tóm tắt cuộc họp và xuất thẳng vào Obsidian.

Bước 1: Cấu hình thư mục Obsidian của bạn

Bạn chỉ cần mở tệp auto_transcribe.py bằng bất kỳ trình chỉnh sửa văn bản nào (như TextEdit) và sửa đường dẫn Obsidian của bạn ở đầu file:

# Sửa đường dẫn tới Obsidian Vault của bạn
OBSIDIAN_VAULT_DIR = "/đường_dẫn_tới_thư_mục_Obsidian_của_bạn"

Bước 2: Cách vận hành quy trình tự động hóa

Cách A: Chạy thủ công nhanh (Double-click)

Cách B: Thiết lập Phím tắt toàn hệ thống (macOS Shortcuts)

Để có thể bấm phím tắt khi đang làm việc ở bất kỳ ứng dụng nào: 1. Mở ứng dụng Phím tắt (Shortcuts) mặc định của macOS. 2. Tạo một phím tắt mới tên là TypeWhisper Auto. 3. Kéo hành động Run AppleScript (Chạy kịch bản AppleScript) vào thiết kế và dán đoạn mã sau (nhớ thay thế đường dẫn thư mục dự án của bạn): applescript on run {input, parameters} tell application "Terminal" do script "/đường_dẫn_thư_mục_dự_án/TypeWhisper_Auto.command" activate end tell return input end run 4. Tại cột bên phải (tab Details), chọn Add Keyboard Shortcut (Thêm phím tắt bàn phím) và nhấn tổ hợp phím bạn muốn sử dụng. 5. Cấp quyền: Vào Cài đặt hệ thống > Quyền riêng tư & Bảo mật > Truy cập ổ đĩa đầy đủ (Full Disk Access), kích hoạt bật xanh cho Terminal.


👥 Làm việc nhóm & Cập nhật Phiên bản (Git Coworking)

1. Đẩy mã nguồn lên GitHub

Đẩy toàn bộ thư mục lên Git bình thường. File .gitignore đã được thiết lập để tự động bỏ qua các file nặng (mô hình AI) và các thông tin bảo mật của bạn.

2. Nhận thông báo phiên bản mới tự động

Mỗi khi máy chủ proxy khởi động, nó sẽ tự động kiểm tra xem trên nhánh main của repository GitHub của bạn có phiên bản mới hơn không. Nếu có, một thông báo macOS sẽ tự động xuất hiện:

"Có bản cập nhật mới (vX.Y.Z). Hãy chạy file update.command để nâng cấp."

3. Nâng cấp nhanh (1-Click Upgrade)

Khi có bản cập nhật mới, bạn hoặc thành viên trong nhóm chỉ cần Double-click vào file update.command trong thư mục dự án. Script sẽ tự động tải code mới (git pull), cập nhật thư viện, kiểm tra mô hình mới và khởi động lại dịch vụ ngầm.


👥 Tác giả & Đóng góp (Credits)