'DB' 카테고리의 글 목록
스키마(Schema)란 무엇인가?
스키마(Schema)란?스키마는 데이터베이스에서 데이터가 어떻게 구성되고, 저장되고, 서로 관계를 맺는지를 정의한 “설계도” 또는 “구조 정의”입니다. IBM은 데이터베이스 스키마를 테이블명, 필드, 데이터 타입, 테이블 간 관계, 제약조건 등을 포함해 관계형 DB 안에서 데이터가 어떻게 조직되는지를 정의하는 구조라고 설명합니다. 쉽게 말하면, 스키마는 실제 데이터가 아니라 데이터를 담기 위한 틀입니다. IBM은 스키마를 데이터베이스의 “blueprint”라고 설명하며, 스키마 자체는 데이터를 포함하지 않고 데이터가 어떻게 관계를 맺을 수 있는지를 설명한다고 정리합니다. 예시로 이해하기회원 관리 시스템이 있다고 하면, 스키마에는 다음과 같은 정보가 정의됩니다.구분예시테이블users, orders, pr..
벡터 DB(Vector Database)의 주요 특징
벡터 DB는 텍스트, 이미지, 음성, 영상, 코드 등 비정형 데이터를 임베딩(embedding)이라는 고차원 숫자 벡터로 변환해 저장하고, 의미적으로 가까운 데이터를 빠르게 검색하는 데이터베이스입니다. AWS는 임베딩 모델이 데이터의 의미와 문맥을 벡터로 인코딩하고, 벡터 DB가 이 벡터를 고차원 공간의 포인트로 저장·검색한다고 설명합니다.1. 임베딩 기반 데이터 저장벡터 DB의 핵심 저장 단위는 일반적인 문자열이나 숫자가 아니라 고차원 벡터입니다. 예를 들어 문장, 문서, 이미지, 상품 설명, 사용자 행동 로그 등을 ML/AI 임베딩 모델에 넣으면 수백~수천 차원의 숫자 배열로 변환되고, 벡터 DB는 이 배열을 저장합니다.예시는 다음과 같습니다.원본 데이터변환 결과“로그인 비밀번호를 변경하고 싶어요”[..
시계열 DB(Time Series Database)의 주요 특징
시계열 DB는 시간(timestamp)을 기준으로 지속적으로 발생하는 데이터를 저장·조회·분석하는 데 최적화된 데이터베이스입니다. 대표적인 데이터는 서버 메트릭, 애플리케이션 로그, IoT 센서값, 주가/거래량, 네트워크 트래픽, 전력 사용량, 위치 정보 등이 있습니다. AWS는 Amazon Timestream을 IoT 및 운영 애플리케이션의 시계열 데이터를 저장·분석하기 위한 목적형 데이터베이스로 설명하며, InfluxDB 역시 메트릭, 이벤트, 로그, 트레이스 같은 시계열 데이터를 저장하는 고성능 시계열 DB로 소개됩니다. 1. 시간 중심 데이터 모델시계열 DB의 가장 큰 특징은 모든 데이터가 시간값을 핵심 축으로 가진다는 점입니다. 일반적으로 하나의 데이터 포인트는 시간, 측정 대상, 태그 또는 라..
PostgreSQL 특징 설명
PostgreSQL은 오픈소스 기반의 객체-관계형 데이터베이스 관리 시스템, ORDBMS입니다. 일반적인 관계형 DBMS처럼 테이블, SQL, 트랜잭션을 지원하면서도, 확장성·표준 준수·복잡한 쿼리 처리·데이터 무결성 측면에서 강점이 있습니다. 1. 오픈소스 기반의 강력한 RDBMSPostgreSQL은 무료로 사용할 수 있는 오픈소스 DBMS입니다.MySQL, MariaDB와 함께 대표적인 오픈소스 관계형 DBMS로 많이 사용되며, 기업 시스템, 웹 서비스, 데이터 분석, GIS, AI 서비스 백엔드 등 다양한 분야에서 활용됩니다.주요 특징오픈소스 기반SQL 표준 지원테이블, 인덱스, 뷰, 함수, 트리거 지원복잡한 쿼리와 트랜잭션 처리에 강함운영 안정성과 데이터 무결성이 우수함 2. ACID 트랜잭션 지..
Pytorch AI Framework 개발에 좋은 DBMS 솔루션 조합
PyTorch 개발용 DBMS는 무엇을 저장하느냐에 따라 달라집니다.결론부터 말하면, 대부분의 PyTorch 프로젝트에는 PostgreSQL + pgvector 조합을 1순위로 추천합니다. 1순위 추천: PostgreSQL + pgvectorPyTorch 개발에서 가장 무난한 선택은 PostgreSQL입니다.이유는 학습 데이터 메타데이터, 라벨, 실험 결과, 사용자 데이터, 서비스 데이터까지 범용적으로 관리하기 좋고, pgvector를 붙이면 임베딩 벡터 검색까지 함께 처리할 수 있기 때문입니다. pgvector는 PostgreSQL에서 벡터 유사도 검색을 제공하며, exact/approximate nearest neighbor search, L2 distance, inner product, cosine..
시계열 DB vs 일반 DB 차이점
시계열 DB는 시간 순서로 계속 쌓이는 데이터를 다루기 위해 최적화된 DB이고, 일반 DB는 업무 데이터 전반을 저장·조회·수정하기 위한 범용 DB입니다. 1. 핵심 차이 요약구분시계열 DB일반 DB주요 목적시간 기반 데이터 저장·분석범용 업무 데이터 관리데이터 형태timestamp 중심 데이터테이블, 문서, 객체 등 다양한 형태대표 데이터CPU 사용률, 센서 값, 주가, 로그, 트래픽회원, 주문, 상품, 결제, 게시글데이터 흐름계속 추가되는 append 중심추가, 수정, 삭제 모두 빈번조회 방식특정 시간 구간 조회가 많음조건 검색, 조인, 트랜잭션 조회가 많음저장 최적화시간 순 저장, 압축, 파티셔닝정규화, 인덱스, 관계 관리오래된 데이터 처리자동 삭제, 보존 정책, 다운샘플링별도 배치나 아카이빙 설계..