STT và tách người nói luôn cục bộ
Không có cloud-ASR dự phòng. Máy yếu thì Summo gợi ý model nhỏ hơn, không đẩy audio lên server. Chỉ tóm tắt và dịch mới gọi ra ngoài — và tới endpoint bạn chọn, có thể là Ollama chạy ngay trên laptop.
Nhận dạng giọng nói và tách người nói chạy hoàn toàn cục bộ. Audio không rời thiết bị — không phải vì chúng tôi hứa, mà vì không có đường nào để nó đi.
rtf 0.11 · 9× realtime · ram 312 MB · gipformer-65m · offline
Mọi quyết định kỹ thuật trong Summo đều suy ra từ ba điều này.
Ảnh chụp thật từ bản đang chạy, không phải mockup.



Mỗi mốc dưới đây đều có lệnh để chạy lại, không phải một dòng marketing nghe hợp lý. Đo trên máy nào ghi trong ngoặc — bạn chạy lại được.
| Bộ dữ liệu | WER | CER | RTF | Ghi chú |
|---|---|---|---|---|
| Fleurs VI (15 clip, 146s) | 2.4% | 1.7% | 0.024 | giọng đọc |
| Ghi âm họp thật (34s) | — | — | 0.107 | gồm cả re-decode để hiện chữ live |
| Số buổi họp | Dung lượng | Tìm kiếm (8 luồng) | Liệt kê thư viện | Kích thước index |
|---|---|---|---|---|
| 100 | 7 MB | 4 ms | 1 ms | 8 MB |
| 1.000 | 65 MB | 30 ms | 5 ms | 80 MB |
| 5.000 | 327 MB | 140 ms | 26 ms | 402 MB |
Không phải bảng nào cũng công bằng, nên bảng này chỉ ghi những thứ kiểm chứng được từ trang giá của họ.
| Summo | Otter.ai | Fireflies | |
|---|---|---|---|
| Audio rời khỏi máy | Không bao giờ | Có | Có |
| Chạy khi mất mạng | Có | Không | Không |
| Bot vào phòng họp | Không cần | Có | Có |
| Giới hạn phút/tháng | Không | Có | Có |
| Dữ liệu của bạn | File Markdown | Trên server họ | Trên server họ |
| Mã nguồn mở | AGPL-3.0 | Không | Không |
| Giá | Miễn phí | $16.99/user | $18/user |
Không có "gói cơ bản" hay "gói cao cấp". Mỗi model là một manifest độc lập ghi rõ dung lượng, RAM cần, tốc độ đo được trên từng loại CPU, ngôn ngữ hỗ trợ và giấy phép. Summo đo máy bạn rồi gợi ý model hợp — bạn vẫn chọn được cái khác.
Hôm nay chỉ có một thứ để trả tiền: không gì cả. Bản app đầy đủ là mã nguồn mở và miễn phí, không giới hạn. Hai gói dưới đây là dịch vụ đồng bộ — chưa xây xong, chưa bán, và ghi ở đây để bạn biết trước cái gì sẽ tính tiền và cái gì không.
0đ
mãi mãi, mã nguồn mở
Tải về—
đồng bộ đa thiết bị, mã hoá đầu cuối
Báo tôi khi có—
cho tổ chức
Liên hệTechainer — công ty AI ở Hà Nội, thành lập 2019.
Techainer làm AI cho việc thật: giám sát video (Horus), định danh điện tử (Master eKYC), số hoá tài liệu (DocChain). Hơn 2 triệu lượt eKYC đã đăng ký và 100.000 chứng từ ngân hàng đã số hoá — nghĩa là hệ thống của chúng tôi chạy trong môi trường mà sai một lần là có người phải xử lý hậu quả.
Summo ra đời từ chính nhu cầu nội bộ: họp bằng tiếng Việt, biên bản viết tay, và không ai muốn đẩy bản ghi cuộc họp nội bộ lên máy chủ của một công ty ở nước khác. Cách rẻ nhất để giải quyết chuyện đó là làm cho việc gửi đi trở thành không thể — nên phần nhận dạng chạy trên máy, và mã nguồn mở để ai cũng kiểm chứng được điều đó.
Giải nén rồi chạy `./summo serve`. Lần đầu chạy, app đo máy bạn rồi hỏi tải model nào — không ghi gì cho tới khi bạn bấm ghi.
Ba cách. Một: mã nguồn mở, phần nhận dạng nằm trong crates/summo-asr và không có client HTTP nào ở đó. Hai: rút mạng rồi ghi — vẫn chạy đủ. Ba: bật tường lửa chặn app, phiên âm không đổi. Chỉ tóm tắt và dịch mới cần mạng, và màn hình Cài đặt ghi rõ endpoint bạn đang dùng là cục bộ hay từ xa.
Không. Summo thu trực tiếp micro và âm thanh hệ thống trên máy bạn, nên nó hoạt động với Zoom, Meet, Teams, cuộc gọi điện thoại, hay họp trực tiếp trong phòng — mọi thứ máy bạn nghe được.
2.4% WER trên Fleurs VI với model gipformer-65M. Nhưng Fleurs là giọng đọc rõ ràng; họp thật khó hơn nhiều, và chúng tôi chưa công bố con số cho họp thật vì chưa có bản chép tay để đối chiếu. Khi có, nó sẽ nằm cạnh con số này.
Có. Từ bản này, dịch 46 ngôn ngữ chạy bằng model trong chính app — không cần Ollama, không cần mạng. Chỉ tóm tắt và hỏi đáp mới gọi tới một mô hình ngôn ngữ, và endpoint đó do bạn chọn.
Lần đầu chạy, Summo đo máy bạn trong 15 giây rồi chọn cặp model phù hợp. Model tiếng Việt mặc định nặng 73 MB và chạy nhanh hơn thời gian thực 9 lần trên CPU bốn nhân — không cần GPU.
Một thư mục Markdown trong thư mục dữ liệu ứng dụng. Mở bằng Obsidian được, grep được, cho vào git được. Audio lưu Opus, mặc định tự xoá sau 30 ngày nhưng giữ lại transcript — bạn đổi được.
App và phần lõi là AGPL-3.0, nên không ai lấy đi làm dịch vụ đóng. Phần trả phí trong tương lai là dịch vụ đồng bộ, nằm ở kho riêng và không cần thiết để app chạy. Doanh nghiệp muốn thoát AGPL thì mua giấy phép thương mại.