NGÀNH CNTT TUYỂN SINH NHIỀU CHỈ TIÊU NGÀNH CNTT, CNTT VIỆT NHẬT VÀ KHOA HỌC DỮ LIỆU

Góc học tập

Dùng AI để phát hiện sớm rủi ro y tế tại Anh

on .

Nhằm khắc phục tình trạng tiêu chuẩn kém trong dịch vụ sức khỏe tâm thần và sản khoa, NHS (Dịch vụ Y tế Quốc gia của Vương quốc Anh) sẽ sử dụng AI để phân tích cơ sở dữ liệu bệnh viện và phát hiện sớm các bê bối tiềm ẩn liên quan đến an toàn y tế.

 

Hệ thống y tế sử dụng AI để phân tích dữ liệu và tăng an toàn y tế. Ảnh: Midjourney

Bộ Y tế và Chăm sóc Xã hội nước này cho biết công nghệ này sẽ cung cấp một hệ thống cảnh báo sớm có khả năng phát hiện các mô hình hoặc xu hướng bất thường và kích hoạt các cuộc thanh tra khẩn cấp. Sáng kiến này nằm trong kế hoạch cải cách 10 năm cho NHS dự kiến sẽ được Bộ trưởng Wes Streeting công bố trong tuần này.

Tuần trước, ông Streeting đã công bố một cuộc điều tra quốc gia về dịch vụ sản khoa và sơ sinh của NHS với mục tiêu mang lại “sự thật và trách nhiệm giải trình”, xem xét những vấn đề đã xảy ra trong suốt 15 năm qua. Báo cáo dự kiến sẽ công bố vào tháng 12/2025.

Từ tháng 11, một “hệ thống tín hiệu” sẽ được triển khai trên toàn bộ các tổ chức NHS, sử dụng dữ liệu gần như theo thời gian thực để giám sát tỷ lệ thai chết lưu, tử vong sơ sinh và chấn thương não cao bất thường - trọng tâm chính của công tác cải thiện chất lượng chăm sóc sản khoa.

Bộ trưởng Streeting cho biết: “An toàn và trao quyền cho bệnh nhân là trọng tâm trong kế hoạch y tế 10 năm của chúng tôi. Bằng cách áp dụng AI và đưa vào hệ thống cảnh báo sớm lần đầu tiên trên thế giới, chúng tôi sẽ phát hiện các dấu hiệu nguy hiểm sớm hơn và tiến hành thanh tra nhanh chóng trước khi sự cố xảy ra.

“Công nghệ này sẽ cứu sống nhiều người: phát hiện chăm sóc không an toàn trước khi nó trở thành thảm kịch. Đây là bước quan trọng trong cam kết đưa NHS chuyển từ ‘thời kỳ analog’ sang ‘kỹ thuật số’, mang đến dịch vụ chăm sóc tốt hơn, an toàn hơn cho mọi người.”

GS. Meghana Pandit - Giám đốc y tế quốc gia phụ trách chăm sóc cấp hai của NHS, cho biết, NHS tại Anh sẽ là quốc gia đầu tiên trên thế giới thử nghiệm hệ thống cảnh báo hỗ trợ AI để phát hiện các vấn đề an toàn bệnh nhân. Hệ thống này sẽ phân tích nhanh dữ liệu bệnh viện thường xuyên và các báo cáo do nhân viên y tế tại cộng đồng gửi về. “Biện pháp này sẽ đẩy nhanh tốc độ và hiệu quả trong việc phát hiện những mối lo ngại về an toàn, từ đó cho phép chúng tôi phản ứng kịp thời để cải thiện chất lượng chăm sóc”, Giáo sư nói.

Tuy nhiên, GS. Nicola Ranger - Tổng thư ký Hội Điều dưỡng Hoàng gia, cho rằng việc dùng AI để duy trì an toàn bệnh nhân không thể thay thế cho việc tăng số lượng nhân viên y tế. Bà Ranger nói: “Công nghệ luôn có vai trò quan trọng, nhưng việc đầu tư đúng chỗ nên bắt đầu bằng việc có đủ nhân viên ở tuyến đầu để đảm bảo an toàn cho bệnh nhân”.

(Nguồn: theguardian.com)

Nguồn: https://baomoi.com/dung-ai-de-phat-hien-som-rui-ro-y-te-tai-anh-c52698480.epi?utm_source=dapp&utm_campaign=share

Các phần mềm có thể dùng để quản lý dữ liệu lớn

on .

Dưới đây là 4 phần mềm phổ biến có thể dùng để quản lý dữ liệu lớn (Big Data):

  1. Apache Hadoop

    • Hệ sinh thái mã nguồn mở chuyên dùng cho xử lý và lưu trữ dữ liệu lớn.

    • Gồm các thành phần chính như HDFS (Hadoop Distributed File System) và MapReduce.

    • Phù hợp với xử lý hàng loạt trên hạ tầng phân tán.

  2. Apache Spark

    • Nền tảng xử lý dữ liệu lớn rất nhanh nhờ khả năng xử lý in-memory.

    • Hỗ trợ nhiều ngôn ngữ (Python, Scala, Java, R) và các mô-đun như Spark SQL, Spark Streaming, MLlib (máy học), GraphX (đồ thị).

    • Thường được dùng thay thế hoặc kết hợp với Hadoop.

  3. MongoDB

    • Cơ sở dữ liệu NoSQL dạng tài liệu, thích hợp cho dữ liệu phi cấu trúc hoặc bán cấu trúc.

    • Khả năng mở rộng ngang tốt, hỗ trợ phân mảnh (sharding), tái lập dữ liệu (replication).

    • Được dùng trong các ứng dụng thời gian thực hoặc có cấu trúc dữ liệu linh hoạt.

4. Oracle Big Data Platform (nền tảng dữ liệu lớn của Oracle) bao gồm:

  • Oracle Big Data Appliance: phần cứng tích hợp sẵn Hadoop, NoSQL, và các công cụ phân tích dữ liệu lớn.

  • Oracle Big Data SQL: cho phép truy vấn dữ liệu lớn từ Hadoop, NoSQL và Oracle DB bằng SQL thống nhất.

  • Oracle Autonomous Data Warehouse: dịch vụ kho dữ liệu tự động hóa, mở rộng tốt, phù hợp cho xử lý dữ liệu lớn theo thời gian thực.

Ưu điểm của Oracle trong Big Data:

  • Kết hợp tốt giữa dữ liệu có cấu trúc (SQL) và phi cấu trúc (NoSQL, Hadoop).

  • Hệ thống bảo mật, quản trị và hiệu suất cao, được các tập đoàn lớn tin dùng.

  • Hỗ trợ tích hợp với các công cụ học máy, phân tích nâng cao.

Tóm lại, Oracle là một lựa chọn mạnh và đáng tin cậy cho quản lý dữ liệu lớn, đặc biệt khi bạn đã sử dụng hệ sinh thái Oracle hoặc cần độ ổn định, bảo mật cao.

Mời báo cáo seminar học thuật của Khoa

on .

Seminar tháng 6 khoa KHKTTT 

 
Nội dung: A Quick Review on Cost-Efficient LLMs for Scientific Text
 
Thời gian: 19:30 thứ 2, ngày 30/7/2025.
 
Nền tảng: Google Meet 

CHUẨN HÓA TỪ VỰNG TIẾNG VIỆT CHO VĂN BẢN TRUYỀN THÔNG XÃ HỘI

on .

CHUẨN HÓA TỪ VỰNG TIẾNG VIỆT CHO VĂN BẢN TRUYỀN THÔNG XÃ HỘI

LÊ THANH PHONG – 21520395 NGUYỄN THANH NHI – 21521232

Trong bối cảnh mạng xã hội tại Việt Nam phát triển mạnh mẽ với hàng chục triệu người dùng, việc xử lý ngôn ngữ tự nhiên (Natural Language Processing - NLP) trên các văn bản không chính thống như bình luận trực tuyến, tin nhắn hay bài đăng đang trở thành một thách thức lớn. Những biến thể ngôn ngữ như viết tắt, teencode, hoặc lỗi chính tả thường xuyên xuất hiện, khiến các mô hình NLP truyền thống - vốn được huấn luyện trên văn bản chuẩn - gặp nhiều khó khăn trong việc hiểu và xử lý.

Trước nhu cầu cấp thiết đó, khóa luận "Chuẩn hóa từ vựng tiếng Việt cho văn bản truyền thông xã hội" được thực hiện với mục tiêu xây dựng một hệ thống giúp chuyển đổi những từ ngữ phi chuẩn trong văn bản mạng xã hội sang dạng chuẩn, từ đó hỗ trợ nâng cao hiệu quả cho các bài toán xử lý ngôn ngữ khác như phân tích cảm xúc, phát hiện ngôn ngữ thù địch hay phát hiện spam.

Điểm nổi bật của khóa luận là xây dựng ViLexNorm – một bộ ngữ liệu chuẩn hóa từ vựng tiếng Việt với hơn 10,000 cặp câu được gán nhãn cẩn thận từ dữ liệu Facebook và TikTok. Bên cạnh đó, nhóm sinh viên còn đề xuất phương pháp tổng hợp dữ liệu dựa trên mô phỏng lỗi ngôn ngữ thực tế, giúp mở rộng dữ liệu huấn luyện một cách hiệu quả.

Khóa luận cũng tiến hành thực nghiệm với nhiều nhóm mô hình từ cơ bản đến hiện đại như NLP hiện đại, bao gồm: Recurrent Neural Network, Transformer, Language Model và Large Language Model. Thực nghiệm cho thấy mô hình sequence-to-sequence được huấn luyện trước (pre-trained) đạt hiệu suất cao nhất, với tỉ lệ giảm lỗi (Error Reduction Rate - ERR) là 57.74%. Bên cạnh đó, phương pháp tổng hợp dữ liệu được đề xuất cũng giúp cải thiện hiệu suất mô hình lên 65.22% ERR khi được sử dụng làm dữ liệu tiền huấn luyện (pre-train). Ngoài ra, hiệu suất tốt nhất của các mô hình NLP trong các bài toán downstream có thể được tăng thêm đến 3.87% F1-macro khi áp dụng bước chuẩn hóa từ vựng trước quá trình huấn luyện.

Nhóm hy vọng rằng khoá luận này sẽ đóng góp vào những nỗ lực tiếp theo của bài toán chuẩn hoá từ vựng trên tiếng Việt, và đóng góp vào sự đa dạng của bài toán chuẩn hóa từ vựng đa ngôn ngữ. Hơn nữa, nhóm kỳ vọng đề tài này sẽ đẩy mạnh những nghiên cứu tiếp theo trong việc xử lý dữ liệu nhiễu trên Internet, góp phần xây dựng một môi trường mạng ý nghĩa và lành mạnh.

Trân trọng.

NGHIÊN CỨU XÁC THỰC THÔNG TIN TỰ ĐỘNG DỰA TRÊN NGUỒN TRI THỨC WIKIPEDIA TIẾNG VIỆT

on .

NGHIÊN CỨU XÁC THỰC THÔNG TIN TỰ ĐỘNG DỰA TRÊN NGUỒN TRI THỨC WIKIPEDIA TIẾNG VIỆT

Lê Tuấn Hưng - Tô Trường Long

Trong bối cảnh thông tin sai lệch được lan truyền một cách nhanh chóng trong hệ sinh thái truyền thông như hiện nay, việc kiểm tra sự thật (Fact - Checking) đã trở thành một nhu cầu cấp thiết để bảo vệ tính chính xác và trung thực của thông tin. Mặc dù vấn đề này tồn tại hầu hết ở mọi quốc gia trên thế giới, nhưng đa phần các nghiên cứu và công nghệ hiện tại vẫn chỉ tập trung vào các ngôn ngữ có nhiều tài nguyên như tiếng Anh hay tiếng Trung, để lại khoảng trống lớn cho các ngôn ngữ ít tài nguyên như tiếng Việt. Vì lý do đó, nhu cầu cho việc khám phá các phương pháp và đặc biệt là các bộ dữ liệu mới nhằm hỗ trợ cho việc xây dựng các hệ thống xác thực thông tin trên tiếng Việt là vô cùng cần thiết. Nhằm đóng góp trong việc thu hẹp khoảng cách về tài nguyên so với các ngôn ngữ khác, nhóm xin giới thiệu khóa luận tốt nghiệp của nhóm với mục tiêu giới thiệu bộ dữ liệu ViWikiFC (Vietnamese Wikipedia Fact-Checking) - một bộ dữ liệu được gán nhãn thủ công dành riêng cho việc kiểm tra sự thật dựa trên nguồn thông tin là Wikipedia tiếng Việt. ViWikiFC bao gồm 20.916 câu tuyên bố được tạo ra thông qua quá trình chuyển đổi các câu bằng chứng được trích xuất từ các bài viết trên Wikipedia. Các tuyên bố này được gán nhãn cẩn thận và phân loại theo các nhãn: Hỗ trợ (Supported), Phản bác (Refuted) và Không đủ thông tin (Not Enough Information). Bộ dữ liệu này không chỉ đóng góp cho nguồn dữ liệu của bài toán kiểm tra thực tế tiếng Việt mà còn được phân tích kỹ lưỡng từ nhiều khía cạnh ngôn ngữ khác nhau nhằm thể hiện sự đa dạng ngôn ngữ trong dữ liệu. Bên cạnh giới thiệu bộ dữ liệu, nhóm đồng thời thực hiện những nghiên cứu, phân tích trong việc sử dụng các mô hình ngôn ngữ lớn (LLMs) vào quá trình xây dựng dữ liệu cho bài toán kiểm chứng sự thật trong tiếng Việt với mong muốn nhằm khắc phục những hạn chế hiện có của bộ dữ liệu ViWikiFC (bao gồm thời gian xây dựng, chi phí gán nhãn và bộ dữ liệu ViWikiFC chỉ tập chung vào xác thực thông tin trên một câu bằng chứng) cũng như đánh giá khả năng tạo sinh của các mô hình ngôn ngữ lớn trong việc tạo sinh dữ liệu cho bài toán kiêm chứng sự thật trong tiếng Việt nói chung và tạo sinh dữ liệu cho các bài toàn khác thuộc lĩnh vực khoa học máy tính nói chung. Trong quá trình đánh giá, phân tích ở cả bộ dữ liệu ViWikiFC và khả năng của LLMs, nhóm sử dụng các kỷ thuật phân tích về khía cạnh ngôn ngữ cũng như thông qua hiệu suất của các mô hình đơn ngôn ngữ và các mô hình đa ngôn ngữ nổi tiếng.

Trân trọng.