Bản tin AI Daily 21/09/2026: Runway Biến Video AI Thành Livestream Tương Tác Thời Gian Thực, Alibaba Tung Qwen-Image-2.1 Thách Thức Model Đóng

Bản tin AI Daily 21/09/2026: Runway Biến Video AI Thành Livestream Tương Tác Thời Gian Thực, Alibaba Tung Qwen-Image-2.1 Thách Thức Model Đóng

Mục lục

Chào buổi sáng anh em yêu công nghệ! Bản tin AI Daily ngày 21/09/2026 tiếp tục đưa chúng ta đến với những chuyển biến ngoạn mục ở ranh giới giữa nghiên cứu mô hình nền tảng và ứng dụng thực tiễn. Điểm nhấn chấn động nhất hôm nay thuộc về Runway với tham vọng tái định nghĩa hoàn toàn trải nghiệm sáng tạo video: thay vì phải gõ prompt rồi ngồi chờ hàng phút để nhận về từng đoạn clip, hãng đang nghiên cứu xây dựng hệ thống sinh video trực tiếp dạng livestream tương tác theo thời gian thực. Ở mảng thị giác máy tính, đội ngũ Qwen của Alibaba tiếp tục khẳng định vị thế dẫn đầu trong hệ sinh thái mã nguồn mở khi ra mắt Qwen-Image-2.1 chỉ với 7 tỷ tham số, sẵn sàng chạy ngay trên GPU người dùng phổ thông nhưng lại hỗ trợ định dạng ảnh trong suốt nguyên bản và tiếp nhận tới 10 ảnh tham chiếu cùng lúc. Trong khi đó, Tencent vừa hé lộ kiến trúc tác tử hội thoại Gander đầy sáng tạo với cơ chế phân tách đại não và tiểu não, giải quyết bài toán muôn thuở khi AI phải vừa duy trì mạch trò chuyện trơn tru vừa âm thầm cày cuốc các tác vụ nặng ở chế độ nền. Ở góc nhìn thị trường, một bài phân tích chuyên sâu tại hội nghị All In đã vạch trần bức màn bí mật bao quanh các startup mô hình thế giới đình đám như AMI Labs hay World Labs, nơi hàng tỷ USD vốn đầu tư đang đối mặt với câu hỏi hóc búa về sản phẩm thương mại cụ thể. Cuối cùng, Microsoft bắt tay cùng Đại học Illinois Urbana-Champaign phát triển nền tảng StudentSim, tạo ra các bản sao học sinh ảo biết mắc lỗi tư duy để đào tạo các gia sư AI thế hệ mới với tốc độ vượt bậc. Cùng điểm qua chi tiết 5 tâm điểm công nghệ nóng nhất ngay sau đây!

🎥 Runway muốn biến AI video thành livestream tương tác điều khiển theo thời gian thực

Runway vừa hé lộ một cái nhìn sâu sắc vào hướng nghiên cứu mang tính cách mạng: tạo video AI theo thời gian thực (real-time video generation). Thay vì quy trình quen thuộc mà mọi người dùng đều phải trải qua là nhập một đoạn mô tả (prompt), hồi hộp chờ đợi vài chục giây đến vài phút để nhận về một đoạn clip tĩnh rồi chỉnh sửa lại từ đầu nếu kết quả không vừa ý, Runway hướng tới việc biến quá trình này thành một luồng video phát trực tiếp (live stream) được dựng ngay khi người dùng thao tác. Hãng cho biết các nhà sáng tạo nội dung liên tục phản ánh rằng họ mất nhiều thời gian nhất ở khâu chờ kết xuất và tinh chỉnh lặp đi lặp lại. Mục tiêu chiến lược của Runway là giảm thiểu tối đa độ trễ đến khung hình đầu tiên (time to first frame), sau đó liên tục truyền tải luồng video trực tiếp dựa trên các mệnh lệnh tương tác nối tiếp.

Nền tảng kỹ thuật cho bước chuyển dịch này dựa trên GWM-1 (General World Model), mô hình thế giới tổng quát đầu tiên được Runway giới thiệu vào cuối năm 2025. Được xây dựng dựa trên thế hệ Gen-4.5, GWM-1 có khả năng sinh video tuần tự theo từng khung hình và tiếp nhận trực tiếp nhiều nguồn tín hiệu điều khiển phong phú: từ quỹ đạo di chuyển camera, lệnh điều khiển robot, âm thanh cho đến tương tác người dùng. Minh chứng rõ nét nhất là dự án Solaris vừa ra mắt gần đây, cho phép mô hình sinh ra giao diện người dùng (UI) động theo từng khung hình. Việc chuyển đổi từ render tĩnh sang livestream tương tác theo thời gian thực không chỉ mở toang cánh cửa cho ngành sản xuất điện ảnh kỹ thuật số, mà còn đặt nền móng vững chắc cho các trò chơi điện tử thế hệ mới, nơi toàn bộ môi trường 3D và vật lý được mô phỏng trực tiếp bằng mạng nơ-ron thay vì các engine đồ họa truyền thống.

Nguồn: The Decoder

🎨 Alibaba phát hành Qwen-Image-2.1: Model 7B mã nguồn mở thách thức các đối thủ đóng

Đội ngũ phát triển AI Qwen trực thuộc tập đoàn Alibaba vừa chính thức trình làng Qwen-Image-2.1, mô hình thị giác mã nguồn mở (open-weight) thế hệ mới dành riêng cho tác vụ khởi tạo và chỉnh sửa hình ảnh nâng cao. Điểm đáng kinh ngạc nhất của bản phát hành này là kích thước vô cùng gọn nhẹ: toàn bộ thành phần sinh ảnh trực quan chỉ vỏn vẹn 7 tỷ tham số (7B). Với kích thước này, mô hình có thể vận hành trơn tru trên các dòng GPU máy trạm phổ thông như NVIDIA RTX 3090 mà không đòi hỏi các cụm máy chủ đám mây đắt đỏ. Dù có cấu hình tinh gọn, Qwen tuyên bố mô hình đã vượt qua hầu hết các đối thủ độc quyền đóng trên bộ chuẩn đánh giá nội bộ của hãng, đặc biệt là ở độ chính xác khi tái hiện văn bản và độ sắc nét chi tiết.

Về mặt tính năng thực tế, Qwen-Image-2.1 mang đến hai bước nhảy vọt quan trọng cho cộng đồng thiết kế. Đầu tiên, mô hình hỗ trợ khởi tạo và chỉnh sửa định dạng ảnh trong suốt (RGBA) một cách nguyên bản, cho phép người dùng cô lập vật thể, tách nền hoặc thay đổi nội dung chữ trực tiếp trên các layer trong suốt mà không cần qua các phần mềm đồ họa bên ngoài. Thứ hai, hệ thống có khả năng xử lý đồng thời tới 10 ảnh tham chiếu cùng lúc, phục vụ xuất sắc các nhu cầu phức tạp như ghép ảnh chân dung tập thể từ các cá nhân riêng lẻ, thử trang phục ảo (virtual try-on), hoặc thiết kế lại phối cảnh nội thất căn phòng. Nhờ những cải tiến kiến trúc sâu sắc trong việc tái sử dụng bộ đệm KV cache, tốc độ suy luận của mô hình đã được đẩy lên mức tối đa. Hiện Qwen-Image-2.1 đã được phát hành rộng rãi trên Hugging Face, GitHub và ModelScope, mở ra một lựa chọn mã nguồn mở cực kỳ đáng giá cho giới phát triển.

Nguồn: The Decoder

🧠 Tencent giới thiệu Gander: Kiến trúc đại não và tiểu não giúp AI vừa trò chuyện vừa làm việc ngầm

Tencent vừa công bố kết quả nghiên cứu ấn tượng với mô hình Gander, một hệ thống đột phá kết hợp mượt mà giữa khả năng đàm thoại thời gian thực bằng giọng nói và năng lực thực thi tác vụ phức tạp của các tác tử tự hành (AI agents). Trong các hệ thống trợ lý ảo hiện tại, khi người dùng yêu cầu thực hiện một tác vụ đòi hỏi suy luận sâu như tìm kiếm tài liệu, rà soát mã nguồn hay gọi API ngoài, mô hình thường rơi vào trạng thái im lặng kéo dài khiến mạch giao tiếp bị gián đoạn vụng về. Gander giải quyết triệt để vấn đề này bằng một cấu trúc phân tầng thông minh lấy cảm hứng từ hệ thần kinh sinh học, chia tách hệ thống thành hai bộ phận độc lập: tiểu não (cerebellum) và đại não (brain).

Trong kiến trúc này, tiểu não đóng vai trò quản lý luồng hội thoại liên tục theo từng giây, xử lý đồng thời âm thanh, hình ảnh và văn bản để đưa ra phản hồi tức thì và cho phép người dùng ngắt lời tự nhiên bất cứ lúc nào. Trong khi đó, đại não là một mô-đun suy luận có thể tráo đổi linh hoạt (swappable), âm thầm chạy ngầm để lập kế hoạch nhiều bước, truy vấn cơ sở dữ liệu hoặc viết mã mà không làm đóng băng giao diện nói chuyện. Kết quả thử nghiệm thực tế cho thấy Gander ngắt lời người dùng ít hơn đáng kể so với các mô hình đối thủ, tạo cảm giác giao tiếp tự nhiên như giữa người với người. Dù báo cáo cũng thừa nhận vẫn còn sự đánh đổi nhẹ về độ chính xác khi giải quyết tác vụ phức tạp, nhóm nghiên cứu Tencent khẳng định sẽ sớm mở mã nguồn và trọng số mô hình trên GitHub để cộng đồng cùng hoàn thiện.

Nguồn: The Decoder

🌐 Bí ẩn quanh làn sóng “World Models”: Hàng tỷ USD đầu tư nhưng sản phẩm cụ thể vẫn mịt mù

Tại hội nghị All In vừa diễn ra, phiên thảo luận về các mô hình thế giới (world models) đã thu hút sự chú ý đặc biệt khi vén màn góc khuất bí ẩn bậc nhất trong bức tranh công nghệ AI hiện nay. Những cái tên đình đám như AMI Labs (thành lập bởi Yann LeCun) hay World Labs (do Fei-Fei Li sáng lập với sản phẩm thử nghiệm Marble) đang trở thành tâm điểm thu hút dòng vốn đầu tư mạo hiểm khổng lồ cùng sự quan tâm cuồng nhiệt từ giới công nghệ. Về mặt lý thuyết, mục tiêu cốt lõi của mô hình thế giới là tự động hóa trí thông minh không gian (spatial intelligence), mở ra tiềm năng thương mại vô tận cho ngành chế tạo robot, video tương tác và hệ thống xe tự hành cấp độ cao.

Thế nhưng, khi các chuyên gia và phóng viên công nghệ cố gắng đào sâu vào câu hỏi bao giờ và bằng cách nào công nghệ này sẽ được thương mại hóa cụ thể, câu trả lời nhận lại đều rất mơ hồ. Các nhà sáng lập và lãnh đạo nghiên cứu, điển hình như đại diện từ AMI Labs, luôn giữ thái độ cực kỳ kín tiếng với những phát biểu dè dặt rằng công ty vẫn đang trong giai đoạn nghiên cứu cơ bản và từ chối tiết lộ lộ trình sản phẩm hay nguồn dữ liệu huấn luyện. Sự bí ẩn này trải dài khắp toàn bộ phân khúc mô hình thế giới, đặt ra dấu hỏi lớn cho giới đầu tư: liệu các hệ thống mô phỏng 3D hiện tại đã đủ trưởng thành để trở thành sản phẩm kinh doanh thực thụ hay vẫn chỉ dừng lại ở các bản demo công nghệ hào nhoáng, trong khi chi phí nghiên cứu và huấn luyện đang tiêu tốn hàng trăm triệu USD mỗi quý.

Nguồn: TechCrunch

🎓 Microsoft và UIUC ra mắt StudentSim: Tạo học sinh ảo biết làm sai để huấn luyện gia sư AI

Một nghiên cứu hợp tác đáng chú ý giữa Microsoft và Đại học Illinois Urbana-Champaign vừa giới thiệu hệ thống StudentSim, mang đến một cách tiếp cận hoàn toàn mới trong việc đào tạo các gia sư trí tuệ nhân tạo. Lâu nay, một gia sư AI chỉ thực sự phát huy hiệu quả khi có khả năng thấu hiểu điểm mạnh, điểm yếu và điều chỉnh phương pháp sư phạm cho từng học sinh cụ thể. Tuy nhiên, việc thử nghiệm và tinh chỉnh các phản hồi sư phạm trên học sinh thật là một quy trình cực kỳ đắt đỏ, tốn kém thời gian và vướng phải nhiều rào cản đạo đức nghiêm ngặt, khiến sự phát triển của mảng công nghệ giáo dục AI tụt lại khá xa so với tốc độ bùng nổ của các mô hình ngôn ngữ nền tảng.

Để phá vỡ thế bế tắc này, StudentSim sử dụng lượng dữ liệu hành vi ban đầu rất hạn chế của từng người học để xây dựng nên các bản sao kỹ thuật số (digital replicas) tương ứng. Điều đặc biệt là các học sinh ảo này không được lập trình để trả lời hoàn hảo, mà được thiết kế để tái hiện chính xác những hiểu lầm phổ biến và các sai sót nhận thức thực tế của con người trong các môn học như cờ vua, toán học và lập trình. Nhờ đó, các nhà nghiên cứu có thể đưa gia sư AI vào thử nghiệm phản hồi với hàng ngàn kịch bản dạy học khác nhau một cách nhanh chóng với chi phí gần như bằng không. Thử nghiệm trên 60 mô hình học sinh cho thấy gia sư AI cải thiện rõ rệt năng lực sư phạm và kỹ năng gợi mở vấn đề, mở ra triển vọng xây dựng các hệ thống gia sư cá nhân hóa chất lượng cao cho hàng triệu người học trên toàn cầu.

Nguồn: The Decoder

Chia sẻ :