Tích hợp đầy đủ các API AI y khoa, nhận dạng giọng nói, OCR, và chatbot thông minh
Hệ thống cung cấp 15 dịch vụ đang hoạt động với AI Agent trung tâm — 7 GPU services, 8 non-GPU services
Trợ lý AI tổng hợp thông minh — tự động nhận biết ý định và điều phối đến đúng service: ASR, OCR, dịch thuật, tóm tắt, tìm kiếm mã y tế, TTS, bệnh nhân ảo và hơn thế nữa. Hỗ trợ hội thoại có lịch sử session, streaming WebSocket real-time.
Nhận dạng giọng nói y khoa tiếng Việt — 2 Workers + GPU Load Balancer, tối ưu tải real-time
API nhận dạng khuôn mặt với độ chính xác cao
Google Gemma 4 E2B — khoảng 5,1 tỉ tham số (lượng tử hóa AWQ 4-bit), ngữ cảnh tối đa 8.192 token, hỗ trợ tiếng Việt và 140+ ngôn ngữ. Hỗ trợ multimodal — nhận diện hình ảnh, video và audio qua API OpenAI-compatible — tối ưu cho phân tích hình ảnh y khoa (X-quang, CT, MRI) và suy luận lâm sàng.
Giám sát và quản lý tài nguyên 5 GPU trong thời gian thực — VRAM, utilization, nhiệt độ, điều phối workload
LLM Qwen2.5-7B-Instruct-AWQ — hỗ trợ tool calling, primary LLM của AI Agent, worker trong team mode cùng Gemma4 và Qwen3
MỘT trọng số nền: Qwen3-14B-AWQ (14 tỉ tham số, AWQ 4-bit) phục vụ HAI định danh: medgemma-1.5-4b-it (suy luận/trích xuất) và qwen3-14b (tầng điều phối). Ngữ cảnh tối đa 8.192 token. Nguồn thay thế medGemma 1.5 4B (bfloat16) có thể bật cùng cổng khi cần, hiện KHÔNG chạy. Chạy trên GPU RTX 5060 Ti 16GB.
Công cụ sinh ảnh phục vụ giảng dạy y khoa: (1) tạo chân dung bệnh nhân ảo theo hồ sơ JSON với 7 nhóm lứa tuổi/giới tính — người Việt Nam, đặc điểm Đông Á; (2) tạo hình hệ cơ quan kèm bệnh lý từ ảnh gốc (vd: ảnh mắt → mắt viêm xung huyết), giữ cấu trúc ảnh tham chiếu. Chạy trên ComfyUI + SDXL.
Gemma 4 Multimodal — Cùng model Gemma 4 E2B nhưng expose qua endpoint riêng /gemma4-mm/ để thử nghiệm. Hỗ trợ image+text+audio input. Sử dụng OpenAI-compatible API với base64 image. Dùng chung vLLM backend (port 8092) với gemma4 text service. Qwen3 tạm dừng. GPU 1 hiện chạy medGemma 1.5 Multimodal y khoa.
Hệ thống Hỗ trợ Chẩn đoán Lâm sàng - LLM + Clinical Reasoning Maps + GNN/Bayesian Inference trên GPU. Phân tích triệu chứng, tính xác suất chẩn đoán động.
Mô phỏng bệnh nhân ảo với RAG và LLM cho giáo dục y khoa
Chuyển văn bản thành giọng nói tự nhiên - Hỗ trợ 28+ ngôn ngữ
Agent AI tự chủ chạy DeepSeek R1 — quản lý task, lập lịch, thực thi pipeline phân tích phức tạp. Kết nối từ máy chủ 192.168.1.248.
Đang kiểm tra trạng thái services...