5CD-AI là nhóm nghiên cứu trí tuệ nhân tạo của những người trẻ Việt Nam. Chúng tôi nghiên cứu mô hình ngôn ngữ, thị giác máy tính, AI đa phương thức và dữ liệu tiếng Việt — từ những ý tưởng khoa học đến các mô hình, bộ dữ liệu và công trình được chia sẻ với cộng đồng.5CD-AI là nhóm nghiên cứu trí tuệ nhân tạo của những người trẻ Việt Nam. Chúng tôi nghiên cứu mô hình ngôn ngữ, thị giác máy tính, AI đa phương thức và dữ liệu tiếng Việt — từ những ý tưởng khoa học đến các mô hình, bộ dữ liệu và công trình được chia sẻ với cộng đồng.
Từ những bộ dữ liệu đầu tiên được công bố vào cuối năm 2023, 5CD-AI tiếp tục nghiên cứu, phát triển và chia sẻ tài nguyên AI tiếng Việt với cộng đồng mã nguồn mở.
80+Bộ dữ liệu AI
12+Mô hình AI
2,6MLượt tải
400+Người theo dõi cộng đồng
1.517Lượt thích ❤️
ĐƯỢC CỘNG ĐỒNG QUỐC TẾ GHI NHẬN
Từ Việt Nam, góp mặt trong dòng chảy nghiên cứu AI.
Hugging Face · AIWorld.eu · Trích dẫn học thuật quốc tế
Cuộn để xem thêm dấu ấn
2024 · HUGGING FACE✦ TOP 20 DATASETS OF 2024
Góp mặt trong top 20 bộ dữ liệu được yêu thích năm 2024
Bộ dữ liệu của chúng tôi, LLaVA-CoT-o1-Instruct, góp mặt trong Dataset Darlings: Most Liked Datasets of 2024 do Hugging Face và AIWorld.eu, hai tổ chức có hoạt động tại châu Âu, giới thiệu, bên cạnh các bộ dữ liệu của OpenAI, Google, NVIDIA và Microsoft.
Danh sách do Hugging Face và AIWorld.eu công bố · Nhấn ảnh để xem rõ hơnXem tổng kết năm ↗Xem bài chia sẻ ↗TỪ VIỆT NAM ĐẾN CỘNG ĐỒNG NGHIÊN CỨU QUỐC TẾ
Được trích dẫn và tiếp tục phát triển
Vintern-1B được trích dẫn trong các báo cáo InternVL 2.5 thuộc Shanghai AI Laboratory, AndesVL của OPPO AI Center và Pangea của nhóm nghiên cứu tại Carnegie Mellon University (Mỹ). Tại Việt Nam, Vintern được các nhóm nghiên cứu ở đại học tiếp tục phát triển; phiên bản Vintern-3B-beta còn được ban tổ chức VLSP 2025 MLQA-TSR chọn làm mô hình đối chứng cho bài toán hỏi đáp đa phương thức.
Sơ đồ phương pháp Vintern-1B · Nhấn ảnh để xem rõ hơnHUGGING FACE · LƯỢT TẢI
Điều hướng hành vi và nghiên cứu an toàn của mô hình ngôn ngữ.
SẮP RA MẮT
Vietnamese Handwriting
Nhận dạng và xử lý chữ viết tay tiếng Việt.
SẮP RA MẮT
Nôm OCR
Nhận dạng ký tự chữ Nôm từ tư liệu hình ảnh.
05 THE PEOPLE BEHIND RESEARCH
Phía sau mỗi công trình là những con người.
Đằng sau các mô hình và bộ dữ liệu là những giờ đọc paper, viết code, phân tích lỗi và tranh luận về một giả thuyết. Chúng tôi đến với nghiên cứu bằng niềm đam mê, sự kiên nhẫn và mong muốn học hỏi lẫn nhau.
5CD-AI trân trọng tinh thần cộng tác: chia sẻ cách làm, ghi nhận đóng góp và cùng giải quyết những câu hỏi mà một người khó có thể trả lời một mình.
“AI nguồn mở của thế giới đã đưa chúng ta đi được một đoạn đầu. Nhưng có những chặng đường, chúng ta phải tự bước tiếp.”THE 5CD-AI SPIRIT
5CD-AI được xây dựng từ sự tò mò khoa học và mong muốn tự tay giải quyết những bài toán trí tuệ nhân tạo. Chúng tôi học bằng cách nghiên cứu, hiểu bằng cách thực nghiệm và trưởng thành qua những lần thử sai. Mỗi mô hình, bộ dữ liệu hay báo cáo đều là một bước trên hành trình ấy.
Chúng tôi quan tâm cả câu hỏi nền tảng — làm thế nào để AI học, hiểu và suy luận tốt hơn — lẫn những thách thức gần gũi như xử lý tiếng Việt, nhận dạng chữ viết và hiểu tài liệu. Những đóng góp có thể nhỏ, nhưng được xây dựng bằng tinh thần khoa học nghiêm túc và mong muốn chia sẻ tri thức.
01
Tò mò
Không ngừng đặt câu hỏi, tìm hiểu cơ chế và giới hạn của mô hình.
02
Thực nghiệm
Đưa giả thuyết vào dữ liệu, mô hình và đánh giá có thể kiểm chứng.
03
Chia sẻ
Công bố kết quả, tài nguyên và kinh nghiệm để tri thức được phát triển tiếp.
5CD-AI · HÀNH TRÌNH VẪN TIẾP DIỄN
Hãy luôn khát khao. Hãy cứ dại khờ.
Phía trước còn rất nhiều điều chưa biết, rất nhiều bài toán chưa có lời giải. Chúng tôi sẽ tiếp tục học hỏi, thực nghiệm và chia sẻ — bằng sự tò mò của người làm khoa học và niềm tin vào năng lực sáng tạo của người Việt.