'DB' 카테고리의 글 목록
본문 바로가기

반응형

DB

(12)
ChromaDB(크로마DB) 완전 정리 ChromaDB는 AI 애플리케이션을 위한 오픈소스 벡터 데이터베이스입니다. 텍스트·이미지·오디오 등을 임베딩(embedding, 고차원 숫자 벡터)으로 변환해 저장하고, 의미 기반(semantic) 유사도 검색을 빠르게 수행하는 것이 핵심입니다. Apache 2.0 라이선스로 공개되어 있으며, pip install chromadb 한 줄로 바로 쓸 수 있는 간편함 덕분에 RAG(검색증강생성) 프로토타입의 사실상 표준 출발점으로 자리 잡았습니다. 지현 차장님께서 폐쇄망 음성 어시스턴트 데모(Qwen LLM + Whisper + RAG 파이프라인)를 다루고 계신 맥락에 특히 잘 맞는 도구라, 실무 관점까지 포함해 정리했습니다.1. 핵심 개념 — 무엇을 하는가ChromaDB는 RAG 시스템에서**"장기 기억..
스키마(Schema)란 무엇인가? 스키마(Schema)란?스키마는 데이터베이스에서 데이터가 어떻게 구성되고, 저장되고, 서로 관계를 맺는지를 정의한 “설계도” 또는 “구조 정의”입니다. IBM은 데이터베이스 스키마를 테이블명, 필드, 데이터 타입, 테이블 간 관계, 제약조건 등을 포함해 관계형 DB 안에서 데이터가 어떻게 조직되는지를 정의하는 구조라고 설명합니다. 쉽게 말하면, 스키마는 실제 데이터가 아니라 데이터를 담기 위한 틀입니다. IBM은 스키마를 데이터베이스의 “blueprint”라고 설명하며, 스키마 자체는 데이터를 포함하지 않고 데이터가 어떻게 관계를 맺을 수 있는지를 설명한다고 정리합니다. 예시로 이해하기회원 관리 시스템이 있다고 하면, 스키마에는 다음과 같은 정보가 정의됩니다.구분예시테이블users, orders, pr..
관계형 DB(RDBMS)의 주요 특징 관계형 DB(Relational Database)는 데이터를 행(row)과 열(column)로 구성된 테이블(table) 형태로 저장하고, 테이블 간 관계를 **기본키(Primary Key)**와 **외래키(Foreign Key)**로 표현하는 데이터베이스입니다. PostgreSQL 공식 문서도 PostgreSQL을 RDBMS로 설명하며, 관계(relation)는 사실상 테이블을 의미하고, 각 테이블은 이름이 있는 row의 집합이며 각 row는 동일한 column 구조를 가진다고 설명합니다. 1. 테이블 기반 데이터 구조관계형 DB는 데이터를 테이블, 행, 열로 구성합니다. 테이블은 고객, 주문, 상품 같은 하나의 주제나 엔터티를 표현하고, 행은 개별 레코드, 열은 각 레코드의 속성을 의미합니다. 예를 ..
벡터 DB(Vector Database)의 주요 특징 벡터 DB는 텍스트, 이미지, 음성, 영상, 코드 등 비정형 데이터를 임베딩(embedding)이라는 고차원 숫자 벡터로 변환해 저장하고, 의미적으로 가까운 데이터를 빠르게 검색하는 데이터베이스입니다. AWS는 임베딩 모델이 데이터의 의미와 문맥을 벡터로 인코딩하고, 벡터 DB가 이 벡터를 고차원 공간의 포인트로 저장·검색한다고 설명합니다.1. 임베딩 기반 데이터 저장벡터 DB의 핵심 저장 단위는 일반적인 문자열이나 숫자가 아니라 고차원 벡터입니다. 예를 들어 문장, 문서, 이미지, 상품 설명, 사용자 행동 로그 등을 ML/AI 임베딩 모델에 넣으면 수백~수천 차원의 숫자 배열로 변환되고, 벡터 DB는 이 배열을 저장합니다.예시는 다음과 같습니다.원본 데이터변환 결과“로그인 비밀번호를 변경하고 싶어요”[..
시계열 DB(Time Series Database)의 주요 특징 시계열 DB는 시간(timestamp)을 기준으로 지속적으로 발생하는 데이터를 저장·조회·분석하는 데 최적화된 데이터베이스입니다. 대표적인 데이터는 서버 메트릭, 애플리케이션 로그, IoT 센서값, 주가/거래량, 네트워크 트래픽, 전력 사용량, 위치 정보 등이 있습니다. AWS는 Amazon Timestream을 IoT 및 운영 애플리케이션의 시계열 데이터를 저장·분석하기 위한 목적형 데이터베이스로 설명하며, InfluxDB 역시 메트릭, 이벤트, 로그, 트레이스 같은 시계열 데이터를 저장하는 고성능 시계열 DB로 소개됩니다. 1. 시간 중심 데이터 모델시계열 DB의 가장 큰 특징은 모든 데이터가 시간값을 핵심 축으로 가진다는 점입니다. 일반적으로 하나의 데이터 포인트는 시간, 측정 대상, 태그 또는 라..
PostgreSQL 특징 설명 PostgreSQL은 오픈소스 기반의 객체-관계형 데이터베이스 관리 시스템, ORDBMS입니다. 일반적인 관계형 DBMS처럼 테이블, SQL, 트랜잭션을 지원하면서도, 확장성·표준 준수·복잡한 쿼리 처리·데이터 무결성 측면에서 강점이 있습니다. 1. 오픈소스 기반의 강력한 RDBMSPostgreSQL은 무료로 사용할 수 있는 오픈소스 DBMS입니다.MySQL, MariaDB와 함께 대표적인 오픈소스 관계형 DBMS로 많이 사용되며, 기업 시스템, 웹 서비스, 데이터 분석, GIS, AI 서비스 백엔드 등 다양한 분야에서 활용됩니다.주요 특징오픈소스 기반SQL 표준 지원테이블, 인덱스, 뷰, 함수, 트리거 지원복잡한 쿼리와 트랜잭션 처리에 강함운영 안정성과 데이터 무결성이 우수함 2. ACID 트랜잭션 지..
Pytorch AI Framework 개발에 좋은 DBMS 솔루션 조합 PyTorch 개발용 DBMS는 무엇을 저장하느냐에 따라 달라집니다.결론부터 말하면, 대부분의 PyTorch 프로젝트에는 PostgreSQL + pgvector 조합을 1순위로 추천합니다. 1순위 추천: PostgreSQL + pgvectorPyTorch 개발에서 가장 무난한 선택은 PostgreSQL입니다.이유는 학습 데이터 메타데이터, 라벨, 실험 결과, 사용자 데이터, 서비스 데이터까지 범용적으로 관리하기 좋고, pgvector를 붙이면 임베딩 벡터 검색까지 함께 처리할 수 있기 때문입니다. pgvector는 PostgreSQL에서 벡터 유사도 검색을 제공하며, exact/approximate nearest neighbor search, L2 distance, inner product, cosine..
시계열 DB의 압축 방식 시계열 DB의 압축 방식은 시간 순서대로 쌓이는 데이터의 반복성, 연속성, 유사성을 활용해 저장 공간을 줄이는 방식입니다.일반 DB 압축보다 시간값과 측정값의 패턴을 적극적으로 이용한다는 점이 핵심입니다. 시계열 DB의 압축 방식1. 시간 차이 기반 압축, Delta Encoding시계열 데이터는 대부분 일정한 간격으로 들어옵니다.예를 들어 1초마다 수집되는 데이터라면 timestamp가 다음처럼 증가합니다. 10:00:0010:00:0110:00:0210:00:03이 경우 전체 timestamp를 매번 저장하지 않고, 이전 시간과의 차이값만 저장합니다. 기준 시간: 10:00:00차이값: +1초, +1초, +1초이렇게 하면 긴 timestamp 값을 반복 저장하지 않아도 되므로 저장 공간을 크게 줄일 ..
시계열 DB vs 일반 DB 차이점 시계열 DB는 시간 순서로 계속 쌓이는 데이터를 다루기 위해 최적화된 DB이고, 일반 DB는 업무 데이터 전반을 저장·조회·수정하기 위한 범용 DB입니다. 1. 핵심 차이 요약구분시계열 DB일반 DB주요 목적시간 기반 데이터 저장·분석범용 업무 데이터 관리데이터 형태timestamp 중심 데이터테이블, 문서, 객체 등 다양한 형태대표 데이터CPU 사용률, 센서 값, 주가, 로그, 트래픽회원, 주문, 상품, 결제, 게시글데이터 흐름계속 추가되는 append 중심추가, 수정, 삭제 모두 빈번조회 방식특정 시간 구간 조회가 많음조건 검색, 조인, 트랜잭션 조회가 많음저장 최적화시간 순 저장, 압축, 파티셔닝정규화, 인덱스, 관계 관리오래된 데이터 처리자동 삭제, 보존 정책, 다운샘플링별도 배치나 아카이빙 설계..
시계열 DB의 대표적인 솔루션 시계열 DB의 대표 제품은 다음과 같습니다.시계열 DB 대표 제품제품특징주 사용 분야InfluxDB시계열 데이터 저장·조회에 특화된 대표적인 오픈소스/상용 시계열 DB이며, Telegraf·Chronograf·Kapacitor 등과 함께 모니터링/IoT 환경에서 많이 사용됩니다. IoT, 모니터링, 센서 데이터TimescaleDBPostgreSQL 확장 기반의 시계열 DB로, SQL과 PostgreSQL 생태계를 그대로 활용할 수 있는 것이 장점입니다. PostgreSQL 기반 서비스, 분석, 운영 데이터Prometheus모니터링과 알림에 특화된 오픈소스 시계열 DB로, PromQL, Pull 기반 수집, Alertmanager 연동이 특징입니다.서버/애플리케이션/Kubernetes 모니터링Victori..

반응형