Giới thiệu
AI tạo sinh (Generative AI) là nhóm các mô hình trí tuệ nhân tạo có khả năng tạo ra nội dung mới — văn bản, hình ảnh, âm thanh, code — thay vì chỉ phân loại hay dự đoán như các mô hình AI truyền thống. Điểm khác biệt cốt lõi: AI truyền thống trả lời câu hỏi "cái này thuộc loại nào?", còn AI tạo sinh trả lời "tiếp theo nên là gì?".
ChatGPT, Claude, Gemini đều thuộc nhóm này. Chúng được xây dựng trên nền tảng gọi là Large Language Model — mô hình ngôn ngữ lớn, thường viết tắt là LLM.
LLM là gì và hoạt động như thế nào
LLM là mô hình học máy được huấn luyện trên lượng văn bản khổng lồ từ internet, sách, tài liệu kỹ thuật. Sau quá trình đó, mô hình học được cách "dự đoán từ tiếp theo" với xác suất cao nhất trong ngữ cảnh đã cho.
Nói đơn giản: khi bạn gõ "Thủ đô của Việt Nam là", LLM tính toán rằng từ tiếp theo có xác suất cao nhất là "Hà" rồi "Nội". Quá trình này lặp lại từng token cho đến khi tạo ra câu trả lời hoàn chỉnh.
Token không hoàn toàn bằng từ. Trong tiếng Anh, "running" có thể là 1 token, nhưng "ChatGPT" có thể bị tách thành "Chat" + "G" + "PT". Trong tiếng Việt, tokenization phức tạp hơn vì mỗi âm tiết thường là 1 token riêng. Đây là lý do tại sao khi dùng LLM với tiếng Việt, chi phí token thường cao hơn tiếng Anh với cùng nội dung.
Kiến trúc bên trong hầu hết LLM hiện đại dựa trên Transformer — một cơ chế cho phép mô hình "chú ý" đến các phần khác nhau của câu khi dự đoán từ tiếp theo. Bạn chưa cần hiểu sâu về Transformer để làm việc với LLM, nhưng cần biết rằng đây là lý do LLM hiểu được ngữ cảnh dài và mối quan hệ giữa các ý trong đoạn văn.
Các khái niệm nền tảng cần nắm
Context window là giới hạn lượng văn bản mà LLM có thể "nhớ" trong một lần xử lý, tính bằng token. GPT-4o có context window 128.000 token, tương đương khoảng 300 trang sách. Vượt quá giới hạn này, mô hình sẽ không thể tham chiếu đến nội dung bị đẩy ra ngoài cửa sổ.
Temperature là tham số điều chỉnh mức độ "sáng tạo" của mô hình. Giá trị từ 0 đến 2. Temperature thấp (0.1 - 0.3) cho kết quả nhất quán, ít biến thiên — phù hợp cho tác vụ phân tích, trích xuất dữ liệu. Temperature cao (0.8 - 1.2) cho kết quả đa dạng hơn — phù hợp cho viết sáng tạo.
Prompt là đầu vào bạn gửi cho LLM. Chất lượng prompt ảnh hưởng trực tiếp đến chất lượng output — đây là lý do cả một lĩnh vực gọi là "prompt engineering" ra đời.
Finetune là quá trình huấn luyện thêm LLM trên tập dữ liệu chuyên biệt để mô hình giỏi hơn trong một domain cụ thể. GPT-4 base được finetune thêm với dữ liệu hội thoại để tạo ra ChatGPT.
So sánh các LLM phổ biến hiện tại
Thị trường hiện có ba nhóm LLM chính bạn sẽ làm việc cùng trong khóa học này.
Nhóm OpenAI gồm GPT-4o và GPT-4o mini. GPT-4o là mô hình đa phương thức (nhận text, hình ảnh, audio), phù hợp cho tác vụ phức tạp. GPT-4o mini rẻ hơn đáng kể và đủ dùng cho phần lớn tác vụ thông thường.
Nhóm Anthropic có Claude 3.5 Sonnet — được đánh giá cao về khả năng lập luận và tuân thủ instruction phức tạp, đặc biệt hữu ích khi xây dựng AI Agent.
Nhóm mã nguồn mở tiêu biểu là Llama (Meta) và Mistral. Ưu điểm là chạy được locally, không tốn chi phí API, phù hợp khi dữ liệu nhạy cảm không thể gửi lên cloud.
Không có mô hình "tốt nhất" tuyệt đối. Lựa chọn phụ thuộc vào yêu cầu cụ thể về chi phí, tốc độ, độ chính xác và chính sách dữ liệu của dự án.
Tổng kết
AI tạo sinh và LLM không phải là công nghệ "thần kỳ" — chúng là các mô hình xác suất được huấn luyện để dự đoán token tiếp theo dựa trên ngữ cảnh. Hiểu điều này giúp bạn đặt kỳ vọng đúng: LLM không "biết" sự thật, chúng "đoán" dựa trên pattern từ dữ liệu huấn luyện.
Ba khái niệm quan trọng nhất từ bài này để mang vào các bài tiếp theo: context window quyết định bộ nhớ làm việc của mô hình, temperature điều chỉnh tính ngẫu nhiên của output, và prompt là đòn bẩy chính bạn có để kiểm soát kết quả.
Bài kiểm tra cuối bài