📈 Thống kê theo ngày
| Ngày | Lượt câu hỏi | Token tiêu thụ | Mức độ |
|---|---|---|---|
💬 Lịch sử câu hỏi
| Thời gian | User | Câu hỏi | Trả lời | Model | Token | Latency | Đánh giá | Xóa |
|---|---|---|---|---|---|---|---|---|
Kéo thả hoặc click để tải lên tài liệu mới
📚 Danh sách tài liệu đã đánh chỉ mục
| Tên file | Loại | Chunks | Kích thước | Ngày upload | Trạng thái | Thao tác |
|---|---|---|---|---|---|---|
📊 Tỷ lệ phân bổ Input / Output
⚡ Tiêu thụ Token theo ngày
🧮 Token Automation chia theo phần prompt
👥 Danh sách người dùng hệ thống
| ID | Tên đăng nhập | Quyền | Số câu hỏi | Ngày tạo | Trạng thái | Hành động |
|---|---|---|---|---|---|---|
⭐ Phản hồi & Đánh giá từ người dùng
| Thời gian | Người dùng | Câu hỏi | Trả lời | Model | Đánh giá | Thao tác |
|---|---|---|---|---|---|---|
https://ollama.com/v1 hoặc dùng cho Ollama Local (mặc định http://localhost:11434/v1).
Lựa chọn phong cách phản hồi và mức độ kiểm soát phạm vi câu hỏi cho trợ lý AI.
Mô hình chuyên biệt phân tích lịch sử 3-4 câu gần nhất (duyệt từ mới nhất đến cũ hơn) để lọc bỏ chủ đề không liên quan, trích xuất Vấn đề cốt lõi, Tiến trình (Đã hỗ trợ vs Điểm nghẽn) và Thông số môi trường khi phát hiện Knowledge Gap hoặc khách yêu cầu gặp KTV.
nhà_cung_cấp:tên_model (ví dụ: groq:llama-3.3-70b-versatile, gemini:gemini-2.5-flash) hoặc để auto để hệ thống tự điều phối theo chuỗi fallback an toàn.
Kiểm soát độ dài tối đa của câu trả lời do AI sinh ra. Hệ thống hỗ trợ tách bạch giới hạn token giữa chế độ Hỏi đáp QnA và chế độ Workflow Automation (để các quy trình phức tạp không bị cắt cụt giữa chừng).
Khuyên dùng 2048 – 4096 tokens để tiết kiệm chi phí và phản hồi nhanh chóng.
Khuyên dùng 8192 – 16384 tokens cho các model suy luận (o4-mini, o1...) để đủ token nối node.
Chỉnh sửa trực tiếp prompt hệ thống cho từng Persona. Thẻ [GAP] giúp hệ thống phát hiện lỗ hổng tài liệu và tự động sinh Support Ticket.
strict
[GAP] để kích hoạt sinh ticket. Với Mode Tự động hóa, prompt định hướng ReAct Agent và tự động kế thừa các quy tắc từ SKILL.md.
Nội dung hiển thị khi người dùng bấm nút "📖 Hướng dẫn" trên thanh công cụ Workflow Mode trong Chat. Hỗ trợ đầy đủ định dạng Markdown.
Khi câu hỏi có URL và cần thao tác phần tử (bấm, nhập, đăng nhập, lấy dữ liệu…), bot quét trang trước khi đoán selector: ưu tiên trình duyệt sống của HideAuto nếu đang ở đúng trang (DOM thật sau JavaScript), không có thì tải nhanh HTML tĩnh (3 giây). Công tắc này chỉ tắt nguồn HTML tĩnh; trình duyệt sống luôn được dùng khi có. (Mặc định BẬT — khoảng 0,6–0,9k token mỗi lượt có quét; chỉ "mở trang, chụp màn hình" thì không quét.)
Bảo vệ độc quyền endpoint /api/chat bằng thuật toán Sliding Window in-memory (không cần Redis). Ngăn chặn flood/spam từ người dùng thường (Tài khoản Admin tự động được miễn trừ).
Cho phép chạy công cụ test tải (Locust / k6) bắn hàng chục nghìn request đo sức bền của CPU, RAM, SQLite và Network mà không tiêu tốn bất kỳ token nào của OpenAI/Gemini.
Khi BẬT: Các câu hỏi ở lượt 2, 3, 4... nếu mang ý nghĩa tương tự câu hỏi đã có trong bộ đệm sẽ được trả lời ngay lập tức (0 token tiêu thụ) mà không cần gọi lại LLM.