Tới nội dung chính
Summo

Mã nguồn mở · AGPL-3.0 · macOS, Windows, Linux

Ghi chú cuộc họp
chạy trên máy bạn.

Nhận dạng giọng nói và tách người nói chạy hoàn toàn cục bộ. Audio không rời thiết bị — không phải vì chúng tôi hứa, mà vì không có đường nào để nó đi.

Không cần tài khoản. Không giới hạn số buổi họp.

summo — đang ghi · 12:04

rtf 0.11 · 9× realtime · ram 312 MB · gipformer-65m · offline

Ba nguyên tắc, không thoả hiệp

Mọi quyết định kỹ thuật trong Summo đều suy ra từ ba điều này.

STT và tách người nói luôn cục bộ

Không có cloud-ASR dự phòng. Máy yếu thì Summo gợi ý model nhỏ hơn, không đẩy audio lên server. Chỉ tóm tắt và dịch mới gọi ra ngoài — và tới endpoint bạn chọn, có thể là Ollama chạy ngay trên laptop.

Bấm ghi là ghi

Phím tắt toàn cục, dưới một giây, không hỏi gì. Tóm tắt chạy sau khi họp xong — vì đó mới là lúc bạn cần nó.

Dữ liệu là file của bạn

Mỗi buổi họp là một file Markdown mở được bằng Obsidian, grep được, sync bằng công cụ bạn đang dùng. Không database, không định dạng riêng, không cần xin export.

Trông như thế này

Ảnh chụp thật từ bản đang chạy, không phải mockup.

Màn hình chính của Summo: thẻ ghi âm, việc đang chờ, và các bản ghi gần đây.
Kho: danh sách bản ghi và ghi chú, lọc theo thư mục, thẻ và màu.
Kho — mọi thứ đã ghi và đã viết, một chỗ.
Bảng việc cần làm ở chế độ sáng, bốn làn kanban.
Việc — rút thẳng từ biên bản, kéo thả giữa các làn.

Số đo thật, không phải lời hứa

Mỗi mốc dưới đây đều có lệnh để chạy lại, không phải một dòng marketing nghe hợp lý. Đo trên máy nào ghi trong ngoặc — bạn chạy lại được.

2.4%
WER tiếng Việt (Fleurs VI)
summo-bench asr
nhanh hơn thời gian thực
summo-bench asr
0.94
F1 phát hiện giọng nói
summo-bench vad
30ms
tìm kiếm 1.000 buổi họp
summo-bench vault
Nhận dạng — gipformer-65M, 4 luồng
Bộ dữ liệuWERCERRTFGhi chú
Fleurs VI (15 clip, 146s)2.4%1.7%0.024giọng đọc
Ghi âm họp thật (34s)0.107gồm cả re-decode để hiện chữ live

RTF 0.107 đã bao gồm việc giải mã lại câu đang nói khoảng mười lần mỗi câu để chữ chạy theo người nói. Giải mã một lần chỉ tốn 0.012 — nghĩa là chín phần mười ngân sách đó dùng để mua chữ hiện ngay, và vẫn còn dư 9× công suất.

Lưu trữ — có cần database không?
Số buổi họpDung lượngTìm kiếm (8 luồng)Liệt kê thư việnKích thước index
1007 MB4 ms1 ms8 MB
1.00065 MB30 ms5 ms80 MB
5.000327 MB140 ms26 ms402 MB

Kết luận: không cần database. 5.000 buổi họp là 327 MB Markdown và tìm được trong 140 ms — nhanh hơn cái ngưỡng 200 ms mà mắt người bắt đầu thấy là chậm.

So với dịch vụ đám mây

Không phải bảng nào cũng công bằng, nên bảng này chỉ ghi những thứ kiểm chứng được từ trang giá của họ.

SummoOtter.aiFireflies
Audio rời khỏi máyKhông bao giờ
Chạy khi mất mạngKhôngKhông
Bot vào phòng họpKhông cần
Giới hạn phút/thángKhông
Dữ liệu của bạnFile MarkdownTrên server họTrên server họ
Mã nguồn mởAGPL-3.0KhôngKhông
GiáMiễn phí$16.99/user$18/user

Giá Otter và Fireflies là gói trả phí thấp nhất tại thời điểm viết, tính theo tháng.

Model như `ollama pull`

Không có "gói cơ bản" hay "gói cao cấp". Mỗi model là một manifest độc lập ghi rõ dung lượng, RAM cần, tốc độ đo được trên từng loại CPU, ngôn ngữ hỗ trợ và giấy phép. Summo đo máy bạn rồi gợi ý model hợp — bạn vẫn chọn được cái khác.

Tiếng Việt, tiếng Anh, và 97 ngôn ngữ khác

Transducer chuyên tiếng Việt cho tốc độ và độ chính xác cao nhất; Whisper cho mọi ngôn ngữ còn lại và cho câu trộn Việt–Anh. Đổi model giữa buổi ghi không mất transcript.

Registry mở, không khoá vào chúng tôi

Manifest là file JSON tĩnh trong một kho công khai. Nếu CDN của Summo biến mất, app tự chuyển sang GitHub rồi tới nguồn gốc trên HuggingFace. Bạn tự host registry riêng cũng được.

Techainer/summo-registry

Giá

Hôm nay chỉ có một thứ để trả tiền: không gì cả. Bản app đầy đủ là mã nguồn mở và miễn phí, không giới hạn. Hai gói dưới đây là dịch vụ đồng bộ — chưa xây xong, chưa bán, và ghi ở đây để bạn biết trước cái gì sẽ tính tiền và cái gì không.

Free

mãi mãi, mã nguồn mở

  • Ghi và phiên âm không giới hạn
  • Tách người nói
  • Dịch 46 ngôn ngữ, chạy trong máy
  • Xuất MD, SRT, VTT, DOCX, PDF
  • Tự cắm LLM key của bạn
  • Không cần tài khoản
Tải về
Chưa có

Sync

đồng bộ đa thiết bị, mã hoá đầu cuối

  • Đồng bộ giữa các máy của bạn
  • Hồ sơ giọng nói dùng lại giữa các buổi
  • Máy chủ không đọc được nội dung
Báo tôi khi có
Chưa có

Team

cho tổ chức

  • Workspace chung, phân quyền
  • Chính sách lưu trữ do admin đặt
  • Self-host và giấy phép thương mại
Liên hệ

Chúng tôi không bán chuẩn ASR. Máy yếu thì Summo gợi ý model nhỏ hơn — độ chính xác thay đổi vì máy bạn, không phải vì bạn không trả tiền. Việc nhận dạng và tách người nói sẽ luôn miễn phí và luôn cục bộ.

Ai làm Summo

Techainer — công ty AI ở Hà Nội, thành lập 2019.

Techainer làm AI cho việc thật: giám sát video (Horus), định danh điện tử (Master eKYC), số hoá tài liệu (DocChain). Hơn 2 triệu lượt eKYC đã đăng ký và 100.000 chứng từ ngân hàng đã số hoá — nghĩa là hệ thống của chúng tôi chạy trong môi trường mà sai một lần là có người phải xử lý hậu quả.

Summo ra đời từ chính nhu cầu nội bộ: họp bằng tiếng Việt, biên bản viết tay, và không ai muốn đẩy bản ghi cuộc họp nội bộ lên máy chủ của một công ty ở nước khác. Cách rẻ nhất để giải quyết chuyện đó là làm cho việc gửi đi trở thành không thể — nên phần nhận dạng chạy trên máy, và mã nguồn mở để ai cũng kiểm chứng được điều đó.

techainer.com

Thành lập
2019
Trụ sở
Hà Nội, Việt Nam
Sản phẩm
Horus · Master eKYC · DocChain · MLChain
Liên hệ
admin@techainer.com

Thử 30 giây là biết

Giải nén rồi chạy `./summo serve`. Lần đầu chạy, app đo máy bạn rồi hỏi tải model nào — không ghi gì cho tới khi bạn bấm ghi.

Mỗi bản tải có file `.sha256` bên cạnh — đối chiếu trước khi chạy nếu bạn cẩn thận.

Bản phát hành đầu tiên đang được dựng. Trong lúc chờ, `cargo run -p summo-cli -- serve` từ mã nguồn chạy được ngay.

Câu hỏi thường gặp

"Audio không rời máy" — kiểm chứng kiểu gì?

Ba cách. Một: mã nguồn mở, phần nhận dạng nằm trong crates/summo-asr và không có client HTTP nào ở đó. Hai: rút mạng rồi ghi — vẫn chạy đủ. Ba: bật tường lửa chặn app, phiên âm không đổi. Chỉ tóm tắt và dịch mới cần mạng, và màn hình Cài đặt ghi rõ endpoint bạn đang dùng là cục bộ hay từ xa.

Có cần bot vào phòng họp không?

Không. Summo thu trực tiếp micro và âm thanh hệ thống trên máy bạn, nên nó hoạt động với Zoom, Meet, Teams, cuộc gọi điện thoại, hay họp trực tiếp trong phòng — mọi thứ máy bạn nghe được.

Tiếng Việt chính xác tới đâu?

2.4% WER trên Fleurs VI với model gipformer-65M. Nhưng Fleurs là giọng đọc rõ ràng; họp thật khó hơn nhiều, và chúng tôi chưa công bố con số cho họp thật vì chưa có bản chép tay để đối chiếu. Khi có, nó sẽ nằm cạnh con số này.

Dịch có chạy cục bộ không?

Có. Từ bản này, dịch 46 ngôn ngữ chạy bằng model trong chính app — không cần Ollama, không cần mạng. Chỉ tóm tắt và hỏi đáp mới gọi tới một mô hình ngôn ngữ, và endpoint đó do bạn chọn.

Máy tôi yếu thì sao?

Lần đầu chạy, Summo đo máy bạn trong 15 giây rồi chọn cặp model phù hợp. Model tiếng Việt mặc định nặng 73 MB và chạy nhanh hơn thời gian thực 9 lần trên CPU bốn nhân — không cần GPU.

Dữ liệu lưu ở đâu?

Một thư mục Markdown trong thư mục dữ liệu ứng dụng. Mở bằng Obsidian được, grep được, cho vào git được. Audio lưu Opus, mặc định tự xoá sau 30 ngày nhưng giữ lại transcript — bạn đổi được.

Vì sao AGPL mà vẫn bán được?

App và phần lõi là AGPL-3.0, nên không ai lấy đi làm dịch vụ đóng. Phần trả phí trong tương lai là dịch vụ đồng bộ, nằm ở kho riêng và không cần thiết để app chạy. Doanh nghiệp muốn thoát AGPL thì mua giấy phép thương mại.