
В данной статье представлены результаты анализа алгоритмов машинного обучения для сентиментального анализа данных на казахском языке, и в результате анализа опрделены эффективные алгоритмы. В связи с увеличением объем казахскоязычного контента в социальных сетях, новостях и интернет-магазинах, также возросла потребность в инструментах и методах обработки данных на казахском языке в целях получения ценной информации о мнениях и взглядах людей. Поэтому набор данных, использованный в исследовании, был собран из реальных интернет-магазинов и новостных сайтов. Объем собранный набор данных составляет 1500 записей, 80% из которых использовались для обучения алгоритмов, а 20% — для тестирования. Для сентиментального анализа данных рассмотрены алгоритмы маштнного обучения такие как логистическая регрессия, мультиномиальный наивный байесовский метод, метод опорных векторов (SVM), XGBoost и длинная краткосрочная память (LSTM) глубокого обучения. В ходе исследования тестирован алгоритмы увеличивая набора данных с 500 записей до 1500 записей, а также были реализованы и протестированы различные методы алгоритмов, такие как индивидуальный, ансамблевый и расширенный. Результаты, полученные в ходе тестирования, были представлены по показателям точности алгоритмов.

В настоящее время теория и методы машинного обучения (МО) быстро развиваются и все шире используются в различных областях науки и техники, в частности в производстве, образовании и медицине. Слабо контролируемое обучение – это часть исследований в области машинного обучения, направленная на разработку моделей и методов анализа различных типов информации. При формулировании задачи обучения со слабо контролируемой обучением предполагается, что некоторые объекты в модели определены неправильно. Эту неточность можно понимать по-разному. Слабо контролируемое обучение – это тип метода машинного обучения, при котором модель обучается с использованием неполных, неточных или неточных сигналов наблюдения, а не с использованием полностью проверенных данных. Слабо контролируемое обучение часто возникает в реальных задачах по разным причинам. Это может быть связано с высокой стоимостью процесса маркировки данных, низкой точностью датчиков, недостатком опыта экспертов или человеческой ошибкой. Например, маркировка плохого контроля осуществляется в случаях, полученных методами краудсорсинга: для каждого объекта имеется набор различных оценок, качество которых зависит от мастерства исполнителей. Другой пример – проблема обнаружения объекта на изображении. Ограничительные линии – это распространенный способ указания местоположения и размера объектов, обнаруженных на изображении, в задачах обнаружения объектов. В статье представлен алгоритм решения многокритериальной задачи слабо контролируемой регрессии с использованием метрики Вассерштейна, различной регуляризации и матрицы коассоциации в качестве матрицы подобия. В работе также был усовершенствован алгоритм расчета средневзвешенной матрицы коассоциаций. Мы сравниваем предложенный алгоритм с существующими алгоритмами обучения с учителем и обучения без учителя на синтетических и реальных данных.

Дүниежүзілік денсаулық сақтау ұйымының мәліметі бойынша, әлемде жыл сайын 17 миллионнан астам адам қан айналымы жүйесінің ауруларынан қайтыс болады, олардың жартысы коронарлық артерия ауруы мен ми инсультінен қайтыс болады. Болжамдық бағалаулар қазіргі өсу қарқынын сақтай отырып, қан айналымы жүйесі ауруларынан болатын өлім-жітім 2024 жылға қарай дүние жүзінде жылына 25 миллион адамға жетуі мүмкін екенін көрсетеді.Инсульт-бұл әртүрлі патогенетикалық механизмдерге негізделген құрылымдық күрделі ауру. Бұл патологияның көп компоненттілігін, сондай-ақ оның күрделі құрылымын ескере отырып, медициналық қауымдастық әртүрлі белгілерді тануға негізделген әртүрлі бағалау алгоритмдерін әзірледі. Бұл алгоритмдердің тиімділігін анықтау ең маңызды деп танылды. Қате белгілер КТ кескіндерін қолмен аннотациялау процесінде рентгенолог жасаған дәлсіздіктер нәтижесінде пайда болады. Науқасқа диагноз кезінде пайда болатын қателіктердің алдын алуға көмектеседі.Конволюциялық нейрондық желі (CNN) мидың инсульт деректері жинағында кескіндерді классификациялауды орындау үшін қолданылады. Деректер жиынтығы аз болғандықтан, бүкіл нейрондық желіні оқыту жақсы нәтиже бермейді, сондықтан дәлірек нәтиже алу үшін модельдік оқыту трансферлік оқыту тұжырымдамасын қолданады. Трансферлік оқыту-бұл белгілі бір тапсырманың моделі басқа тапсырманың бастапқы нүктесі ретінде қолданылатын әдіс. Атап айтқанда, жұмыста қойылған мәселе үшін Imagenet шкалалары бар Inception v3 моделі қолданылады. Машиналық оқытуды пайдалану кезінде мидың 2515 қалыпты және инсульттан зардап шеккен аймақтарының компьютерлік томографиялық суреттері бар деректер жинағы алынды. Құрылған нейрондық желінің міндеті-берілген кескінді классификациялау, яғни оның қалыпты немесе зақымдалған екенін анықтау. Осы алгоритмді қолдана отырып, дәлдік 65 пайыздан 99,2 пайызға дейін өсті, ал шығындар 7,532 пайыздан 0,756 пайызға дейін төмендеді. Негізгі көрсеткіштер: 99,6 % дәлдік, 99,2 % шолу, F1-баға 99,1 % болды.

На сегодняшний день объемы аналитических данных достигли критических масштабов, что ставит под сомнение традиционные методы их хранения, основанные на реляционных базах данных, которые не всегда могут эффективно справляться с такими объемами. Решения NoSQL открывают новые перспективы для обработки аналитических данных, особенно в контексте использования многомерных моделей. Исследования проводимые в данной статье посвящена сравнению возможностей применения NoSQL базы данных для аналитических систем с выбором СУБД ClickHouse. В работе представлен краткий сравнительный анализ преимуществ данной программы. В практической части рассмотрены методы создания многомерной модели данных на основе не реляционных баз данных. В статье приведен ClickHouse на примере создания OLAP с последующим сравнением возможностей с СУБД PostgreSQL. В заключении анализируются архитектура и компоненты OLAP системы.

В статье рассматривается информационная система, позволяющая оптимизировать бизнес-процессы и IT-процессы за счет автоматизации с использованием инструментов проектного управления и предназначенная для интеграции существующих подсистем. Для проектирования любой технологически сложной системы используются специальные инструменты. Архитектор составляет план проекта, инженер – чертёж детали. Бизнес – это такая же сложная система с множеством связей, объектов и взаимодействий. Для построения архитектуры бизнеса используются специальные системы бизнес-моделирования, одной из которых является программа Fox Manager BPA. Для того, чтобы решать проблемы системно, а не интуитивно, необходимо спроектировать архитектуру бизнеса, прописать правила и стандарты работы, распределить ответственность за функции среди персонала и контролировать их выполнение. Представлена информационная система поддержки принятия решений с использованием разнородных пространственных данных для оптимизации процесса управления компанией. Методика, предложенная для верификации ИС впервые применяется в исследуемых системах. В статье также приведены исследования актуальных задач в области информационных технологий в сфере телекоммуникаций. В современных условиях информационные технологии (ИТ) в компаниях присутствуют как необходимый атрибут технологии управления процессом производства товаров и услуг, экономического анализа и принятия управленческих решений. В настоящее время ИТ используются во многих сферах управленческой деятельности, все чаще становятся важным фактором и средством решения многочисленных управленческих задач. Для проектирования любой технологически сложной системы используются специальные инструменты.

В статье приведены исследования актуальных задач в области информационных технологий в сфере телекоммуникаций. В настоящее время в таких условиях очень тяжело найти компанию, которая не занимается развитием информационных технологий, но при этом она успешна и прибыльна. В эпоху цифровых технологий люди концентрируются на производстве и торговле продуктами и услугами через оцифрованные данные, информация и знания. Данная эпоха основана на инфраструктуре, состоящей из информации и коммуникационных технологий. Эта новая инфраструктура не просто помогает людям делать лучше и быстрее, чем в предыдущие эпохи, но открывает новые способы контроля, координации, и сотрудничество в деятельности с наименьшими затратами. Информационные системы становятся все более и более мультимедийными, а также сетевыми. Эта эволюция, а также повышенная скорость изменений предъявляют новые требования к методам и компетенциям, необходимых для разработки последующих информационных систем. В этом разделе мы даем обзор различных типов информационных технологий и методов для развития информационных систем, особенно в отношении мультимедийных аспектов.

Imbalanced learning (IL) poses a major challenge in fraud recognition especially in financial datasets with extreme class imbalances (IR>20:1), where existing sampling techniques such as oversampling and under- sampling fail to address both inter-class and intra-class imbalances. The practical usefulness of current ensemble approaches is limited by their high processing costs or sub-optimal performance. This paper presents the duple-balanced ensemble (DUBE), a novel framework that integrates adaptive resampling with ensemble learning to mitigate inter- and intra-class imbalances simultaneously. Assessed on a real-world financial dataset (n=8,345 transactions, IR=21:1) using Python-based experiments, DUBE was compared with five benchmark classifiers (multilayer perceptron, k-nearest neighbor, bagging, adaptive boosting, decision tree). It achieved a 12% enhancement in F1-score over baseline models with optimal ensemble size of 10, demonstrating robustness to extreme imbalances without relying on computationally expensive distance-based methods. In spite of its robust performance, DUBE may have its efficacy limited by extreme class sparsity or dynamic fraud patterns due to concept drift. These findings highlight DUBE’s potential as a scalable, efficient solution for fraud detection, with future applications in other high-imbalance domains like medical diagnostics and intrusion detection.

This study aims to develop a responsible and sustainable framework for implementing artificial intelligence (AI) in business process management (BPM), with a focus on aligning technological advancement with strategic economic transformation. It addresses the need for ethical, sector-sensitive AI adoption in emerging economies undergoing digital modernization and diversification. The research integrates enterprise information system considerations, privacy-preserving modular architectures, and national regulatory frameworks related to data localization and cybersecurity. A sectoral analysis is conducted to assess global AI adoption maturity and its implications for economic transformation, using Kazakhstan as a contextual reference point. The results reveal that consumer-facing sectors such as retail and financial services exhibit high near-term adoption potential, while healthcare requires gradual infrastructure and talent development. More significantly, mid-term opportunities in manufacturing, logistics, and transportation sectors present Kazakhstan with a comparative advantage. AI adoption in manufacturing is projected to grow by 83% within three to seven years, underscoring the importance of timely investments in automation, smart technologies, and workforce upskilling. This study contributes a context-aware framework for responsible AI-enabled BPM. It offers actionable insights for policymakers and business leaders in emerging economies, advocating for sectoral prioritization, strategic timing, and capacity-building to ensure sustainable digital transformation.

The analysis of tonality in scientific texts, including citations, is actively advancing, enabling the identification of emotional coloring in references and their impact on scientific discourse. This study focuses on developing and evaluating a hybrid approach that integrates linguistic rules (analysis of parts of speech, syntactic dependencies, and negations) with machine learning algorithms (SVM, RF, NB, J48) to classify citation tonality. Experiments were conducted on the ACL Anthology (8700 sentences) and Clinical Trials (6500 additional sentences) corpora using stratified splitting (70/15/15 for train/val/test) and 5-fold cross-validation. The proposed method achieved 90% macro-F1 and 95% F1-score on the Athar dataset, and 85% macro-F1 on Clinical Trials, showing a 10–15% improvement over baseline models (BERT, LSTM). Ablation studies confirmed the contribution of linguistic rules (F1 increase of 5–7% when excluded). Statistical significance tests (McNemar, p<0.05) validated the robustness of the results. The approach proves effective for automated citation analysis and scientific impact assessment.

While automatic image captioning systems have made notable progress in the past few years, generating captions that fully convey sentiment remains a considerable challenge. Although existing models achieve strong performance in visual recognition and factual description, they often fail to account for the emotional context that is naturally present in human-generated captions. To address this gap, we propose the Sentiment-Driven Caption Generator (SDCG), which combines transformer-based visual and textual processing with multi-level fusion. RoBERTa is used for extracting sentiment from textual input, while visual features are handled by the Vision Transformer (ViT). These features are fused using several fusion approaches, including Concatenation, Attention, Visual-Sentiment Co-Attention (VSCA), and Cross-Attention. Our experiments demonstrate that SDCG significantly outperforms baseline models such as the Generalized Image Transformer (GIT), which achieves 82.01%, and Bootstrapping Language-Image Pre-training (BLIP), which achieves 83.07%, in sentiment accuracy. While SDCG achieves 94.52% sentiment accuracy and improves scores in BLEU and ROUGE-L, the model demonstrates clear advantages. More importantly, the captions are more natural, as they incorporate emotional cues and contextual awareness, making them resemble those written by a human.
Показано 741–750 из 3379