Обзор тенденций в публикациях по KG-RAG

В прошлом обзоре мы использовали термин GraphRAG для обозначения технологии извлечения знаний из текста в граф и использования этого графа при формировании контекста LLM для ответов на вопросы пользователей. Начиная с этого обзора будем называть ее термином KG-RAG (Knowledge Graph RAG). Этот термин позволяет избежать путаницы с реализацией GraphRAG от Microsoft.

1. Serratore, G., & Clunis, J. (September 2025). The Integration of Artificial Intelligence and Ontologies: Transformations in Knowledge Representation and Application. Proceedings from North American Symposium on Knowledge Organization, 1–11. https://doi.org/10.7152/nasko.v7i1.95643

Раздел  AI for the construction and populating of ontologies  этой статьи посвящен обзору фреймворков и методик автоматического создания онтологий с помощью LLM и NLP. Рассматриваются как подходы, использующие fine tuning LLM, так и ориентированные на промпт инжиниринг. Отмечается ряд проблем, свойственных некоторым из этих реализаций, такие как недостаточная семантическая выразительность создаваемых классов и свойств (в сравнении с онтологиями, созданными вручную), неверный выбор направления связей, неправильное присвоение области применения и диапазона значений свойств, проблемы генерации синтаксически корректных файлов Turtle и др. Отмечается положительный эффект использования фрагментов онтологий в промптах LLM, позволяющих языковой модели  интернализировать  концептуальную структуру модели предметной области и повысить точность ответов.

2. da Cruz, T., Tavares, B., & Belo, F. (November 2025). Ontology Learning and Knowledge Graph Construction: A Comparison of Approaches and Their Impact on RAG Performance. https://arxiv.org/abs/2511.05991v1

Авторы этого обзора сравнивают векторный RAG, реализацию GraphRAG от Microsoft, а также извлечение информации из графов, наполненных информацией из реляционных БД и текстов, чтобы исследовать влияние применения онтологий на точность и полноту ответов диалоговой системы. Вывод работы состоит в том, что добавление фрагментов текста в качестве свойств вершин графа позволяет улучшить точность извлечения информации из графа. Еще одно очевидное наблюдение состоит в том, что графы знаний, наполненные данными из реляционных СУБД, дешевле и проще в создании и поддержке по сравнению с графами, использующими текст в качестве источника информации. Интерес для нас состоит в том, что в этой работе рассматривается и автоматизация формирования концептуального уровня онтологической модели, то есть извлечение набора типов объектов и свойств из источника данных. Для реляционных БД онтология формируется на основе DDL таблиц, а для текста авторы следуют подходу, описанному в статье Bakker, R.M., Di Scala D.L., & de Boer M. H. T. (2024) Ontology Learning from Text: an Analysis on LLM Performance. In Proceedings of the 3rd International Workshop on Natural Language for Knowledge Graph Creation co-located with 20th International Conference on Semantic Systems (SEMANTiCS 2024). CEUR Workshop Proceedings, vol. 3874, p. 70-87. В этой работе авторы исследовали несколько подходов к генерации концептуального уровня онтологии с помощью LLM: прямой промпт на создание онтологии (заведомо неуспешный вариант); разделение на три подзадачи – извлечение классов, индивидуальных объектов и отношений; вариант второго подхода, при котором классы извлекаются из всего текста сразу, а индивиды и отношения – из каждого предложения отдельно. Результат сравнивался с онтологией, построенной вручную. Последний вариант ожидаемо оказался наиболее эффективным.

3. Работа тех же авторов Bakker, R.M., Di Scala D.L., & de Boer M. H. T. (December 2025). Ontology Learning with LLMs: A Benchmark Study on Axiom Identification. https://arxiv.org/abs/2512.05594 посвящена тестированию различных LLM на задаче извлечения аксиом из нескольких существующих онтологий с применением разных стратегий построения промптов (zero-shot, one-shot и др.). Авторы фокусируются на аксиомах, описывающих отношения классов и свойств, такие как надкласс-подкласс, свойство-подсвойство, области применения и диапазоны значений свойств и др. На вход LLM подается онтология без аксиом, а задача модели состоит в том, чтобы предложить корректные аксиомы, которые могут ее дополнить. Протестирован широкий набор моделей, включая GPT-4o, DeepSeek R1, Mistral 3.1, Llama 3.3, Qwen3 и другие.  Философские  способности LLM пока недостаточны для достижения высоких значений метрик точности и полноты в этой задаче. Наиболее успешно LLM справляются с определением отношений надкласс-подкласс, а GPT-4o показала наилучшую производительность среди всех рассмотренных моделей.

4. Cappelli, M. A., & Di Marzo Serugendo, G. (2025). Methodological Exploration of Ontology Generation with a Dedicated Large Language Model. Electronics, 14(14), 2863. https://doi.org/10.3390/electronics14142863

Авторы работы сосредоточены на взаимодействии человека и генеративной модели в процессе создания онтологии. Они описывают процесс создания онтологии, включающий шесть фаз: теоретическое определение (человек определяет предметную область и задает ее ключевые концепты), исследование и анализ предметной области, синтез онтологии, формализация, самостоятельная оценка и интеграция. Theoretical definition, domain exploration and analysis, ontology synthesis, formalization, self-assessment and integration.

LLM выступает в роли ассистента, предлагающего новые концепты и свойства, а также способы их встраивания в онтологию, и выполняющего некоторые задачи верификации полученной модели. За человеком остается управляющая роль и конечное принятие решений по составу и структуре модели.

Отметим, что авторы этой статьи, как и большинство исследователей, использует большие модели общего назначения (например, ChatGPT-4o), тогда как мы поставили себе задачу реализовать метод, работающий с более простыми моделями.

5. В работе Abolhasani, M. S., & Pan, R. (December 2025). OntoKGen: A Genuine Ontology and Knowledge Graph Generator Using Large Language Model. https://doi.org/10.1109/rams48127.2025.10935139 предлагается еще один вариант построения пайплайна генерации онтологии с помощью LLM, включающий следующие шаги: идентификация концептов (и определение индивидуальных объектов, соответствующих этому концепту), определение типов отношений и связывание конкретных объектов, определение типов свойств и присваивание конкретных значений свойств, верификация и проверка полноты графа.

Насколько можно судить по публикации, подход использует  укрупненные  промпты к LLM, нацеленные на получение готовых классов и концептов. Результат обработки сохраняется в schema-less граф в Neo4j, а значит, полноценная онтология и не нужна: достаточно типизировать объекты и связи, не выстраивая иерархии классов и свойств, не вводя ограничения и другие онтологические аксиомы. На наш взгляд, графы знаний, хранящиеся в neo4j, нельзя в полной мере считать онтологическими. Они подходят для решения задач в предметных областях, где концептуальная структура знаний не очень сложна, а количество индивидуальных объектов и связей, наоборот, очень велико.

6. Работа Park, J., Jeon, H., Lee, Y., Hong, J., & Kim, M. (December 2025). Ontology-Based Knowledge Graph Framework for Industrial Standard Documents via Hierarchical and Propositional Structuring. https://arxiv.org/pdf/2512.08398 рассматривает задачу извлечения фактов и требований из текстов промышленных стандартов, необходимую для создания системы KG-RAG. Авторы предлагают пайплайн, состоящий из трех стадий. Первая стадия, моделирование иерархии онтологии (Hierarchical Ontology Modeling), заключается в отражении иерархической структуры стандартов в модели. Для хорошо структурированных регуляторных документов разделение на разделы, подразделы и главы действительно несет семантическую нагрузку и может быть использовано для формирования онтологического каркаса. Вторая стадия – моделирование отдельных утверждений (Atomic Proposition Ontology Modeling) – отражение смысла высказываний из текста стандарта в триплеты. На этом этапе особое внимание уделяется преобразованию таблиц в наборы фактов. Часто каждая ячейка содержит значение какой-либо величины, которое должно применяться в условиях, задаваемых пересечением строки и столбца. Отметим, что авторы трактуют  триплет  не в привычном для онтологов смысле – как конструкцию из двух вершин, представляющих элементарные сущности, и типизированной связи между ними. В методике авторов рассматриваемой работы триплеты – это элементы описания  случая  (case), или сценария применения требования, связанные с условием (значение клаузы if) и применяемыми требованиями (клауза then). Используется техника few-shot learning, при которой в промпт LLM включается несколько образцов желаемого результата обработки других аналогичных выражений. В процессе извлечения требований строится словарь сущностей и отношений. Для устранения дублирующих определений используется кластеризация с помощью HDBSCAN векторных эмбеддингов, полученных из терминов, определяющих сущности и отношения. Генерируются и конкатенируются три эмбеддинга, полученные на основе текстового определения термина, контекста его использования и позиции термина в структуре графа. Для определений отношений добавляется четвертый эмбеддинг, описывающий типы узлов, связанных данным отношением. Из графа удаляются избыточные связи и дублирующие утверждения. На третьей стадии, создание графа знаний (Ontology-based Knowledge Graph Construction), происходит связывание триплетов-утверждений с онтологической схемой структуры документа.

Для поиска утверждений в графе на стадии извлечения знаний используется поиск разделов документов на основе близости семантических эмбеддингов запроса и каждого раздела стандарта. Контекст запроса к LLM формируется из утверждений, извлеченных из релевантных разделов. Наличие связи между структурой документа и конкретными высказываниями, извлеченными из них, позволяет формировать  доказательство  (evidence) каждого утверждения из ответа LLM.

Оценка результатов показывает, что прирост производительности метода (метрика F1) относительно простого текстового RAG невелик. Достоинством подхода является то, что он сохраняет производительность при росте размера индексируемых документов.

На наш взгляд, данный подход не в полной мере использует преимущества графовой организации знаний. Он настроен на обработку документов определенной структуры, и не может применяться для менее формализованных документов. Структура высказываний, которые становятся элементарными  триплетами  графа знаний, фиксирована и не позволяет отражать сложные комбинации условий, при которых должны применяться те или иные требования. Этап извлечения концептуальной модели не выделен из общего пайплайна, не приводит к формированию машинно-читаемого представления концептуального уровня модели. Концептуальная модель не используется на этапе извлечения знаний. Само извлечение происходит традиционным способом, при помощи векторных эмбеддингов – не делается попытка преобразовывать вопрос пользователя в запрос к графу знаний. Все это ограничивает применимость подхода и те результаты, которые можно получить с его помощью.

Несколько свежих работ посвящены проблемам обработки различных кодов: от кодировок заболеваний в медицинских онтологиях до кодов промышленных изделий или факторов эмиссии промышленных предприятий. LLM плохо справляются с поиском точных кодировок, сопоставлением кодов одного объекта из разных классификаторов, могут путать их или придумывать несуществующие коды. В подобных задачах особенно ярко проявляется необходимость сочетать LLM с использованием структурированных знаний.

7. Zhao, Y., Dai, C. H., Niyato, D., Tan, C. F., Xiang, K., Wang, Y., Yeo, Z., Tan, D. Z. L., Low, J. Z., & Ho, E. H. Z. (June 2025). A Graph-Retrieval-Augmented Generation Framework Enhances Decision-Making in the Circular Economy. https://doi.org/10.21203/rs.3.rs-6795706/v1

Авторы работы строят граф знаний, объединяющий сведения о типах промышленных выбросов, материалов и факторов окружающей среды (waste classifications, materials, and environmental factors (GWP100)) согласно нескольким стандартам, и используют его в задаче получения ответов на вопросы пользователей с помощью LLM. Авторы назвали свое решение CircuGraphRAG. Работа сфокусирована на извлечении данных из графа: процесс его конструирования детально не рассматривается. Можно предположить, что авторы используют структурированные или полу-структурированные источники данных, и заранее заданную концептуальную схему (онтологию). Значительную часть содержания графа составляют сущности, описанные в промышленных стандартах и имеющие определенные значения кодов: это снимает проблему идентификации и классификации сущностей при обработке текстов регуляторных актов.

Для получения ответов на вопросы LLM генерирует SPARQL-запросы к графу, которые возвращают точный результат. Подчеркивается важность корректной работы решения с числовыми значениями различных показателей в задачах, связанных с контролем выполнения регуляторных требований: CircuGraphRAG показывает 100% точность ответов, связанных с числами, чем выгодно отличается от  наивного RAG , который в проведенных авторами тестах не может предоставить ответов на подобные вопросы, либо дает неверные ответы. Авторы экспериментируют с несколькими подходами к построению таких запросов: использование заранее заданных шаблонов запроса (модель только выбирает подходящий шаблон и подставляет в него данные, соответствующие вопросу пользователя), генерация SPARQL-запроса моделью, или fuzzy-подход: генерация SPARQL-запроса с предоставленными в контексте подсказками, касающимися идентификаторов типов сущностей и свойств. Вариант с генерацией SPARQL-запроса моделью  с нуля  не позволяет достичь практически пригодных результатов, а эффективность fuzzy-подхода зависит от типа используемой LLM. Вариант с заранее подготовленной библиотекой шаблонов надёжен, но ограничивает спектр решаемых задач. На наш взгляд, оптимальный баланс универсальности и точности ответов обеспечивает подход, не рассмотренный авторами статьи: конструирование SPARQL-запроса императивным алгоритмом, использующим комбинацию техник, таких как обращение к LLM, идентификация типов сущностей и отношений с помощью векторных эмбеддингов, валидация и корректировка структуры запросов с опорой на концептуальную схему онтологии.

8. Wang, Z. Y. (July 2025). Retrieval-Augmented Question Answering System Based on Large Language Models and Knowledge Graphs. Applied and Computational Engineering, 178(1), 236–245. https://doi.org/10.54254/2755-2721/2025.po25800

Работа посвящена созданию RAG-решения для базы знаний в области дерматологии. В статье описывается полный цикл создания решения – наполнение графа знаний информацией из текстовых документов и реализация диалогового интерфейса для генерации ответов на вопросы пользователей. Используется заранее заданная структура графа знаний, основанная на 19 ключевых свойствах заболеваний, таких как факторы риска, критерии диагностики, симптоматика и др. Перед LLM ставится задача представить содержимое текстовых документов в виде триплетов в терминах заранее заданной онтологии. Результат сохраняется в базе данных Neo4j. При обработке вопроса пользователя сначала определяются упоминаемые в нем сущности и их типы, после чего находятся наиболее релевантные запросу узлы графа. С помощью Cypher-запросов извлекается окружение каждого из релевантных узлов. Из описаний групп узлов графа формируется контекст для LLM.

За пределами нашего обзора остались многие работы, описывающие применение подобных подходов для решения различных отраслевых задач в области биотехнологий и медицины, IoT, инжиниринга, телекоммуникаций, промышленности и строительства.

Анализ актуальных подходов к реализации KG-RAG

Исследователи, работающие с задачами, где для получения корректных ответов в диалоговой системе необходимо точно найти нужный фрагмент исходной информации, зачастую – среди огромного количества текста с одинаковой лексикой, сталкиваются с тем, что с помощью одних только векторных эмбеддингов невозможно осуществлять адекватную навигацию по корпусу текстов. Это приводит к мысли о необходимости представить исходную информацию в более структурированном и формализованном виде, чтобы обеспечить точный выбор информации для контекста. В случаях, когда требуется точный и проверяемый ответ на вопрос, особенно в ситуациях контроля выполнения требований или диалогового взаимодействия с нормативными документами, формирование контекста запроса к LLM даже из релевантных фрагментов текста несет серьезный риск галлюцинаций. В таких случаях и сам ответ должен формироваться на основе выполнения запроса к структурированным данным, а LLM может лишь облечь его в более понятную для человека форму. Эти предпосылки приводят исследователей к постановке и решению задач формирования графа знаний для задач RAG.

При создании решений KG-RAG необходимо решить множество вопросов, основные из которых можно сформулировать так:

  • Концептуальная схема графа знаний (набор типов объектов и свойств): формировать заранее вручную или строить на основе обработки текстов с той или иной степенью автоматизации?
  • Преобразование знаний в соответствии с концептуальной схемой: полностью возложить эту задачу на LLM, предоставляя ей образцы формальной записи информации в виде графа, или использовать то или иное сочетание императивных алгоритмов и средств NLU с обращениями к LLM?
  • Поиск релевантных фрагментов графа знаний: сравнивать векторные эмбеддинги вопроса и узлов графа, или преобразовывать вопрос пользователя в запрос к графу на языке SPARQL или Cypher? Возможны разные варианты сочетания этих подходов, в том числе благодаря возможности хранения эмбеддингов в некоторых хранилищах графов и поддержке ими операций с векторами.
  • Если выбирается путь построения запроса к графу, то следующий возникающий выбор касается способа его генерации: с помощью библиотеки шаблонов, создания запроса целиком средствами LLM, или конструирования запроса по частям. Последний вариант является фаворитом, если нужно находить сложные отношения между вершинами графа: в этом случае задача построения запроса должна опираться на концептуальную схему, чтобы включать в шаблон только допустимые типы отношений и исключить поиск формально верных, но некорректных по сути связей, а также использовать те или иные варианты алгоритма поиска кратчайшего пути в графе.

В зависимости от того, какие ответы на эти вопросы выбирают исследователи, полученное решение обладает большей или меньшей универсальностью и точностью. Мы стремимся к созданию наиболее универсального решения без потери точности, что требует использования сложных, комбинированных методик создания концептуальной схемы, извлечения фактов из текста и формирования контекста LLM для ответов на вопросы.

На наш взгляд, основной вывод из перечисленных работ состоит в том, что нужно рационально разделить задачи на реализуемые императивными алгоритмами и LLM. Так, задача формирования Turtle-файла однозначно реализуема обычной программной процедурой, которая гарантирует синтаксическую корректность результата. Те части задачи, которые выполняются в основном с помощью LLM, например определение области применения и диапазона значений для свойств, должны верифицироваться как с помощью контрольных вопросов (в цикле с обратной связью, который завершается только после всесторонней проверки корректности полученных утверждений), так и с помощью алгоритмических процедур формального уточнения (например, замена перечисления всех подклассов какого-либо класса в области применения свойства на сам этот класс).

Многие подходы стремятся сделать человека участником всех стадий автоматизированного конструирования онтологий. В зависимости от сложности предметной области и требований к точности и выразительности онтологии это может иметь больший или меньший смысл. С точки зрения наших практических задач, верификация онтологии человеком должна происходить один раз, в самом конце ее формирования.

Наш обзор показывает, что подход KG-RAG остается областью активных исследований, где пока не выработан общепринятый подход. Отметим  внутреннюю конкуренцию  подходов, генерирующих строгие концептуальные модели OWL/RDF, и строящих слабо структурированные графы в neo4j. Преимущества обоих подходов перед  наивным  RAG очевидны и количественно доказаны во многих исследованиях, однако преимущества тех или иных вариантов подхода KG-RAG пока остаются предметом дискуссии.

Интересно также отметить, что использование графовых нейросетей (GNNs) в задачах KG-RAG остается вне фокуса внимания исследователей.

Свяжитесь с нами