← 대시보드로
2026-09-06
3개 영상
2026-09-06 06:02 생성
OpenAI's Team Runs One Chat for Months. Here's How.
Dylan Davis 2026-09-06
OpenAI's Team Runs One Chat for Months. Here's How.
↗ 유튜브에서 보기

핵심 요약

과거에는 대화가 길어지면 AI의 성능이 급격히 저하되어 새 대화창을 자주 여는 것이 권장되었으나, 최근 기술 발전으로 단일 대화를 수개월간 유지하는 방식이 더 효과적인 작업이 늘었다. 이는 내부 요약·압축(Compaction) 기술과 도구 자체의 기본 기억(Native Memory) 기능이 크게 개선된 덕분이다. 특히 브라우저 환경보다 데스크톱 에이전트 환경에서 이러한 장기 대화의 이점이 훨씬 강력하게 나타난다.

주요 포인트

  • **대화 압축(Compaction) 기술 도입**: 대화가 길어지면 AI가 이전 맥락의 핵심을 내부적으로 자동 요약하여, 컨텍스트 한계로 인한 지능 저하 없이 대화를 계속 이어갈 수 있음
  • **과거 한계 극복**: 6개월~1년 전만 해도 컨텍스트의 약 50%만 차도 AI의 사고 능력이 급격히 떨어졌으나 현재는 크게 개선됨
  • **자체 기억(Native Memory) 발전**: 사용자 이름, 직업, 위치, 공통 선호도 등 기본 정보를 도구 차원에서 기억하는 기능이 점차 고도화되는 중
  • **환경에 따른 성능 차이**: 일반 웹 브라우저보다 데스크톱 기반 에이전트 도구에서 대화 압축 및 기억 저장 능력이 훨씬 뛰어나 장기 대화 효율이 극대화됨
People inside of Open AI, the company that brought you ChatGPT, now run one AI conversation for months and it gets more useful the longer it goes. If you're new here, I'm Dylan. I run an AI consultancy. And for the past year, I've told my coaching clients the exact opposite advice. Start fresh chats early and often. That advice still holds most of the time, but the tools have changed. And now there's one kind of work where it backfires. I'll show you what changed, the two ways your AI now remembers, and the test that matches each one to the right job. So, let's get into it. Now, there are two key things that have improved both in Claude and ChatGPT around memory and how an AI can have a longer conversation with you. The first thing here is compaction. So, you've probably seen when you're using Claude or ChatGPT, once you've had a really long conversation, it summarizes. And the summarizing effect, what happens, is simply looking at the previous conversation, the AI determines what it feels is most important. It summarizes that to itself, not showing you, and then you can keep having that conversation ongoing. And that's why you can have longer conversations with AI today. Its intelligence doesn't automatically degrade. But it's important to note that this benefit is more obvious in different tools. And I'll talk more about that later. But in the past, probably not even a year ago, but probably even 6 months ago, when you're using these tools, if you had a long conversation with an AI, it got dumb fast. Its intelligence dropped like a rock after around 50% of filling up its head. And that's the reason this happens is the AI only has so much space in its head. So, when you fill the head too much, it doesn't have that much space to actually think about the task at hand. So, this is the first improvement that we've seen around memory and long conversations. The second improvement is native memory in the tools you're using. So, both Claude and ChatGPT have a native memory feature where it can remember things about you. And right now still, this is very surface level. So, most of what it can remember about you are basic facts. So, your name, your location, what you do, and some general preferences that you have that likely map across multiple activities. So, this isn't that detailed. Both of the providers, Anthropic and Open AI, are working heavily to improve these, but right now they're still not that great. And that's the second thing, or the second thing that's improved in the last couple of months. Now, to the point around how these benefits are not equally distributed. So, if you're inside the browser using Claude or ChatGPT, you're still likely not going to see massive uplifts in long conversations and the value associated to those. Reason being is that in desktop agents like Claude Co-work and Codec's, the ability to compact conversations and save memories more effectively is much better. So, you can have much longer conversations. Now, it's important to know if you already have a subscription with ChatGPT or Claude, you already have access to these tools. All you have to do is download them. So, Claude Co-work is for Claude and Codec's is for ChatGPT. Both of which are extremely easy to set up and easy to use. And that's my caveat here. So, if you're not using a desktop agent, I wouldn't recommend watching the rest of this video. But, if you're willing to try it out and or download it, then you can keep going. So, I'm going to walk you through two different setups. Both of which have different configurations of memory. And there are two primary forms of memory that we're going to mix and match for both of the setups. Quick pause. If you're enjoying this, you're going to enjoy two other things. First off, below is a 30-day AI insight series, completely free. You'll get 30 insights in your inbox of how you can apply AI to your business and your work. The second thing is if you'd like to work with me, below are a series of offerings to see if there's a good fit between the two of us. Now, let's get back to the video. The first form of memory is written memory. So, this is the long-term memory the AI will have. And the reason it's written is the AI is going to externalize these memories into files that it can access later on. So, you can think of this kind of like a filing cabinet where really important detailed facts go. The other thing is working memory. So, you can think about this as short-term memory. And this is the memory the AI has for ongoing conversations. So, if each one of these dots on this line are representative of a compaction of a conversation, the AI will have enriched context of previous conversations when you interact with it in future iterations. So, this is the running conversation memory. Those are the two things we have. We're first going to start with setup A. And the reason we're starting with setup A is this is the setup I'd recommend most people start with and most people use for m
How to Build a Real-Life JARVIS With Fable 5.1 (Full Guide)
Nicholas Puru 2026-09-06 설명 기반
How to Build a Real-Life JARVIS With Fable 5.1 (Full Guide)
↗ 유튜브에서 보기

핵심 요약

고성능 AI 모델인 Fable 5.1을 두뇌로 활용하여 영화 속 자비스(JARVIS)처럼 실생활에서 동작하는 개인 맞춤형 AI 비서를 구축하는 전체 가이드 영상이다. 음성 인식 및 합성, 자동화 워크플로우 도구를 연동하여 단순 질의응답을 넘어 일상 업무를 자율적으로 처리하는 시스템 구축법을 다룬다.

주요 포인트

  • **Fable 5.1 기반 두뇌 구축**: 복잡한 추론과 지시 이행 능력이 뛰어난 Fable 5.1 모델을 핵심 엔진으로 채택하여 정교한 판단력 구현
  • **음성 인터페이스 연동**: 실시간 대화가 가능하도록 음성 인식(STT) 및 고품질 음성 합성(TTS, ElevenLabs 등) 기술을 결합하여 자비스 특유의 보이스 경험 제공
  • **자동화 툴 및 API 통합**: n8n 등 워크플로우 자동화 도구를 연결해 이메일 정리, 일정 관리, 웹 검색 등 실제 PC 및 서비스 제어 자동화
  • **실전 구축 및 최적화 팁**: API 비용 최적화, 지연 시간(Latency) 단축, 에러 핸들링 등 실생활에서 지속적으로 사용할 수 있는 환경 설정 노하우 공유
ASTRA에 Superpowers·OMC·GSD 붙였더니 토큰 녹았습니다.
소스놀이터 2026-09-06
ASTRA에 Superpowers·OMC·GSD 붙였더니 토큰 녹았습니다.
↗ 유튜브에서 보기

핵심 요약

ASTRA는 높은 API 단가에도 불구하고 적은 토큰 소모로 작업당 비용과 바이브 코딩 구현력에서 뛰어난 효율을 보여준다. 다만 프롬프트 지시를 극도로 철저히 따르는 특성 탓에 Superpowers, OMC, GSD 같은 복잡한 하네스 스킬을 덧붙이면 과잉 작업 루프가 발생해 토큰이 순식간에 녹아내린다. 따라서 별도 스킬 없는 순정 상태나 얇은 지침으로 사용하고, 기획은 ASTRA, 실행이나 감사는 가성비 모델로 분업하는 전략이 권장된다.

주요 포인트

  • **비용 및 효율성**: API 단가는 비싸지만 작업당 토큰 소모량이 적어, 실제 에이전트 작업당 비용은 경쟁 모델 대비 절반 수준으로 낮게 나타남.
  • **코딩 구현 강점**: 순수 지능이나 대형 코드 이해도는 페이블(클로드)이 앞서지만, 코드 직접 수정 및 구현(바이브 코딩) 영역에서는 ASTRA가 우수한 성능을 발휘함.
  • **과잉 행동 및 토큰 폭증 주의**: 지시를 글자 그대로 수행하므로 복잡한 하네스 세팅(Superpowers, GSD, OMC 등)이나 과도한 검증 지침이 있으면 끝없는 루프를 돌아 비용이 폭발함.
  • **순정 상태 사용 권장**: 최신 모델 자체에 프레임워크가 내장되어 있으므로 무거운 서드파티 스킬을 빼고 순정 상태 또는 최소한의 얇은 지침으로 쓰는 것이 안전함.
  • **역할 분담 활용 팁**: 복잡한 계획 단계나 고난도 작업에는 ASTRA(또는 미디움)를 투입하고, 대량 코드 감사나 단순 실행 단계는 하위 가성비 모델을 섞어 쓰는 방식이 효과적임.
최치피에서 아스트라가 어제 출시되었습니다. 벤치마크상은 놀랍습니다. 많은 영역에서 페이블 5.1도 이깁니다. 짧은 시간이지만 실제로 써 본 사람들의 평가도 좋습니다. 잘한다는 거죠. 반면에 비싼 비용의 소리를 지르는 사람들도 있습니다. 왜 이렇게 비싸? 이걸로 얼마나 쓸 수 있는 거야? 이런 질문들을 하고 있죠. API 비용을 보면 아스트라는 기존에 가장 비쌌던 솔에 비해 2.5배 더 비쌉니다. 감히 안 오시죠? 클로드 5.1과 공교롭게도 완벽히 동일한 금액입니다. 왜 가격을 똑같이 맞췄을까요? 가격을 담합한 걸까요? 아니면 늘 클로드보다 저렴하게 내놓던 최치피티가 페블보다 뭔가 우리가 뛰어나다는 자신감의 표출일까요? 기존에 성능이 비슷하거나 모자할 때는 항상 싸게 내놓다가 이번에는 유독 동일 가격인 거죠. 확실히 저격 모드로 포지셔닝한 느낌이 있습니다. 이에 대한 한 가지 힌트가 있는데 같은 작업을 시키면 더 적은 도큰으로 더 빨리 끝낸다는 오픈 A측의 설명이 있습니다. 그러니까 비싸긴 한데 우린 조금만 써도이를 빨리 끝낸다고 주장하는 거죠. 여기는 민간 AI 벤치마킹 전문 회사의 자료인데 이곳은 실제 사람들을 인정하는 회사입니다. 페이브 5.1도 그렇고 아스트라도 모델을 조기에 제공받아 선 테스트를 진행할 수 있었고 이렇게 자료가 나온 거죠.이 이 자료를 만들기 위해 약 2,000번의 에이전트 작업을 진행한 걸로 알려져 있습니다. 결과를 보면 특히 의미 깊은게 작업당 비용입니다. 패블 5.1에 비해 거의 절반의 비용이 들었습니다. 작업당 토큰 사용량이 확실히 적죠. 그런데 전반적인 능력은 페이블이 더 우세합니다. 실제로 순수 지능은 페이블 쪽이 더 낮다고 평가되고 있어요. 그런데 딥 SWE를 보시면 코덱스가 1% 정도 더 높습니다. 이건 코드 수정하고 구현하는 능력입니다. 그러니까 순수 지능은 낮지만 직접 프로그램 만들 때는 잘한다는 거죠. 하지만 터미널 작업이 주의거나 대형 코드 이에까지 넓히게 되면 페블 5.1이 더 낮습니다. 그래서 바이브 코딩으로 한정하면 성능과 비용 모두 아스트라가 꽤 괜찮다고 볼 수 있습니다. 단지 비용만 본다면 아스트라는 굉장히 매력적입니다. 하지만 아스트라 역시 주의해야 될 특성이 있습니다. GPT는 전통적으로 프롬프트의 지시에 민감하게 반응해서 지시를 그대로 따릅니다. 따라서 환각이 적다는 평가도 많죠. 이런 특성 때문에 장단점이 극명하게 나뉘는데 고능력의 사용자가 제대로 지시하면 GPT는 그야말로 최상의 성능을 발휘합니다. 반면에 페이블은 적당히 지시하더라도 자신의 훌륭한 판단이 감이되면 더 좋은 결과를 내게 됩니다. 그런데 GPT가 지시를 그대로 따른다고 했잖아요. 아스트라는 이면에서 기존 모델보다도 더 잘 따릅니다. 이런 특성의 한네스 설정이 가지면 어떻게 될까요? 아마 한스 세팅하신 분들이 많을 텐데 그대로 쓰면 부작용이 있을 수 있습니다. 철저히 조사해라. 관련된 파일을 다 확인해라. 가능하면 서브 에이전트를 돌려라. 충분히 검증하라. 잠재적 문제를 확인해라. 이런 지침들이 있으면 아스트라가 더 민감하게 따라서 비용이 폭증할 수 있습니다. 간단한 작업에도 과잉 행동을 유발하여 계속 루프를 도는 거죠. 실제 사람들의 평가도 그렇습니다. 일부 사람들은 소의 처리 비용으로 더 빨리 끝냈다는 사람도 있고 단 한 번에 프롬포트에 다섯시간 한도를 거의 소진했다는 사람도 있습니다. 그래서 오픈 AI도 아스트라를 쓰기 전에 지침을 정리하라는 공고를 하고 있죠. 또 위험한 건 하네스케열 스킬들입니다. 슈퍼 my 클러드코 everything 클러드코 GSD BMAD 메드 스펙트 이런 것들이 있으면 과인 작업을 유도할 수 있으니 아스트라에서는 주의하시는게 좋습니다. 저는 5.6부터 아예 저런 스킬들을 안 쓰고 있어요. 앞서 소개해 드린 벤치마킹 회사도 당연히 스킬 없이 순정해서 테스트 했잖아요. 그 결과를 기대한다면 우리도 순정 상태에서 꼭 필요한 지침과 얇은 한를 넣으시길 추천드립니다. 최신 모델에는 이미 한네 체계가 들어와 있다는 것도 기억하시고요. 이제 어떻게이 아스트라를 쓰면 좋을까요? 효율적인 사용 방법으로 계획 단계에서는 아스트라를 쓰고 시행 단계에서는 다른 모델을 쓸 수 있습니다. 그러니까 투네는 고속능으로 하면서 시행은 가성비로 진행하는 거죠. 한편 표보는 적지만 아스트라 미디움에 대한 평가가 꽤 좋습니다. 사용하기로 결정했다면 미디움을 추천드리고요. 그리고 감사를 돌린다면 솔 미디움이나 하이가 더 나을 수도 있습니다. 감사를 할 때에는 코드를 넓게 봐야 합니다. 기껏 비용 아끼려고 가성비 모델로 돌렸는데 그 모든 과정을 아스트라가 다 읽으면서 비용이 확 늘어날 수 있는 거죠. 차라리 하위 모델로 폭넓게 확인하는게 좋을 수 있습니다. 특히 고난일 때에만 아스트라를 쓸 수 있겠죠. 아스트라에 대해 살펴봤는데 바이브 코딩 한 분야로 봤을 때 굉장히 매력적입니다. 이제 모델의 성능이 상당 수준에 달해서 선택치가 다양해졌습니다. 다른 모델이 못 하는게 아니라 더 느리지만 해낸다. 이건 더 싸게 해 준다. 이런 것까지 고려하는 상황입니다. 그만큼 상향 평준화가 되고 있죠. 그럼 여러분들의 후기를 기다립니다.