Not a member of Pastebin yet?
Sign Up,
it unlocks many cool features!
- hôm qua e có nch vs sư phụ
- Trần Nguyễn Duy Tuấn
- Tuấn
- a nghĩ sao về mắt kính cho ngươì khiếm thị
- cần cụ thể hơn
- vì nếu là mắt kính hoàn thiện, hoặc thay mắt như 1 số nơi cũng nghiên cứu và làm thì nó đòi hỏi rất nhiều
- nói chung là anh chưa rõ idea cụ thể em là gì
- scope thế nào
- nó là dạng camera phân tích rồi nói lại cho người ta
- mắt kính có gắn mini camera và 1 cái tai nghe
- về phần xử lý :
- Nếu là người : phân tích tuổi, emotion , male or gemale...
- Nếu là vật : mô tả vật, hình dáng, nó là vật gì, công dụng ...
- Nếu là cảnh vật : phân tích cảnh vật, gồm có những gì trong cảnh vật đó
- Khoảng cách : ước chừng khoảng cách từ người đến vật
- Chữ : text to speech
- tính làm trong bao lâu
- hiện tại microsoft vs google có loại API để xử lý các tác vụ này, chỉ là nó rời rạc và not free
- thời gian e chưa rõ vì nó còn nhiều stack khác với idea e còn chưa được duyệt :v
- anh mà là bgk thì loại ngay
- sao thế a
- đơn giản là cái scope nó quá rộng
- vậy theo a thì scope như nào là vừa :v
- làm sao nhìn vào đó chỉ có 2-3 bài toán cần giải quyết thôi, hoặc thậm chí chỉ có 1, nhưng ứng dụng thì thể nào cũng vài
- độ phức tạp của 1 bài toán nhỏ nữa, chỉ ra 1 bài toán bắt đầu cho những bài toán phía sau (xác định giới tính, cảm xúc, ....)
- thì trong 1 frame ảnh, có bao nhiêu entities trong đó , làm sao chọn được đúng thứ cần để phân tích
- trả lời ý 1 thì cả tỷ thứ, người, bàn ghế, viết,.... rồi trong người thì có mắt, mũi, miệng ....
- ....
- đấy nội việc làm sao để xử lý hình ảnh đó thôi đã là 1 thứ khổng lồ rồi
- nó hoàn toàn khác biệt với việc chú train 1 cái neuron network cho xác định chữ cái, hay đó là con chó con mèo
- chỉ riêng việc xác định đó là con chó hay con mèo google cũng tốn ko biết bao nhiêu tg công sức (ko nói state hiện tại)
- e có thử tải cái ảnh của a về để test thử cái module e dùng
- a năm nay nhiêu tuổi nhỉ :v
- 28
- xê xích 3 tuổi
- Faces [ { "age": 31, "gender": "Male", "faceRectangle": { "width": 137, "height": 137, "left": 159, "top": 101 } } ]
- Tags [ { "name": "outdoor", "confidence": 0.9988287091255188 }, { "name": "tree", "confidence": 0.9911515116691589 }, { "name": "grass", "confidence": 0.9769880771636963 }, { "name": "person", "confidence": 0.9731658697128296 }, { "name": "shirt", "confidence": 0.8072543740272522 }, { "name": "smiling", "confidence": 0.7123119831085205 }, { "name": "posing", "confidence": 0.46504953503608704 } ]
- e dùng library image net của google
- để xác định vật thể có trong bức ảnh
- thế thì nó có ý nghĩa gì
- api của google anh chưa dùng, của microsoft thì dùng rồi, nhưng chỉ là nhận diện khuôn mặt và đưa ra các chỉ số cảm xúc..., hoặc có bao nhiêu người trong ảnh
- tức là đã phải xác định đó là phân tích về những người có trong tấm hình
- scope nó rất rõ ràng nhiêu đó
- còn nó có api xác định trong hình có những đối tượng nào chưa?
- rồi chứ
- để e đưa a xem
- https://www.microsoft.com/cognitive-services/en-us/computer-vision-api
- a xem cái request nó trả về có phần tags
- còn về việc nếu không sử dụng api
- thì gg cũng có 1 mạng lưới image net, có hầu hết toàn bộ 1 kho image của tất cả để xác định
- nó xác định có những đối tượng với info gì?
- hay chỉ là trong hình có water, glass
- có
- nó xác định đối tượng là gì và có mô tả description
- ừ, nó có xác định đối tượng là gì với 1 confidence number
- trong 1 số đối tượng, nó sẽ xác định tính chất đó
- *tính chất của đối tượng đó
- yep, cái confidence number này có thể là do sự đa dạng của dữ liệu
- về việc xác định đối tượng thì độ chính xác khá cao rồi (nó learn khá nhiều nên cái này ok), tính chất trả về ok luôn đi
- yep, chỉ có phần mô tả
- giả sử confidence là 100% luôn
- vậy thì câu hỏi từ ban đầu, em biết cái gì là quan trọng ?
- và dựa vào đâu để biết
- e nghĩ đối với người khiếm thị thì việc chỉ cần biết được mình đang nhìn cái gì là quan trọng nhất, còn việc nó ra thế nào làm sao thì còn tuỳ vào mỗi người suy nghĩ nó như thế nào
- đương nhiên lần đầu làm thì e k thể làm được description info là 100% được
- đó cái em nói "biết được đang nhìn gì"
- anh ko nói là em ko làm được
- vấn đề vẫn là cái scope nó là gì
- API nó chỉ cho em information
- nó cho càng chính xác thì vừa dễ mà cũng vừa khó
- gỉa sử tấm hình cô gái mặc bikini đó đi
- có thêm 1 con chó kế bên
- hoặc 1 đàn chó đi
- cả 2 đều có confidence cao
- thì em bảo có 2 đối tượng đó
- xong tăng thêm con mèo
- rồi tăng thêm con heo chẳng hạn ... và tăng lên cỡ 100 đối tượng có confidence cao hết
- em sẽ bảo với người mù đang nhìn gì
- ý chính của anh là ko phải em ko làm được
- nhưng cách anh nói có nghĩa là
- 1 ví dụ làm vấn đề có thể phức tạp lên
- nếu cứ tăng thêm và có confidence cao e nghĩ cũng bình thường mà ta
- em phải chọn 1 vấn đề để giải quyết
- cho câu bảo bình thường trên
- khi tất cả đều quan trọng
- thì chẳng có gì quan trọng
- e nghĩ người khiếm thị thì họ đâu focus được 1 vật muốn nhìn, cái gì trước mắt họ thì nó báo thôi
- đó
- em thấy cái bug hệ thống ở đây ko "cái gì trước mắt họ thì nó báo thôi"
- confidence tuyệt đối cho 100 vật trước mắt
- thế thì nó báo 100 thứ, người khiếm thị phải nghe 100 tên à
- ý a là độ focus ấy hử
- 100 thôi là đủ chết, chưa nói có khi cả 1000, 10k
- còn việc em bảo có gì nó báo
- thì đúng rồi, em dùng API
- và API nó cho hết rồi
- cái chính là em phải nói từ cái API ấy, em làm cái gì thêm "hợp lý" và giải quyết vấn đề cụ thể cho người khiếm thị
- ví dụ
- e nghĩ chỉ cần giảm bán kính xuống là được thôi, ví dụ trong bán kính 2m từ người mù đi tới, có vật gì báo vật đó
- em giảm xuống còn 20cm cũng vẫn còn vấn đề đó
- em cầm cái máy chụp hình lên chụp bán kính 2m xem thấy cái gì
- nên nhớ là nhìn trong 3D, ko phải 1D hay 2D
- em nhìn thẳng bán kính 2m thì nó ra không khí :))
- thôi anh chuẩn bị ngủ
- cho chú 1 ví dụ tạm gọi là scope phù hợp
- kính xác định VẬT CẢN
- đâu đâu
- cho người khiếm thị
- tức là từ thông tin có được, chú tìm tính chất nào để xác định nó là vật cản thôi
- và vật cản thì chỉ những thứ thẳng trước mặt
- ở một độ cao nhất định
- à
- camera nó có chế độ focus
- just recognition when focus
- **lưu ý: đây chỉ là ví dụ minh hoạ cho việc thu nhỏ scope lại, có indicator để xác định 1 vấn đề nhất định, có thể nó vẫn chưa đủ nhỏ
- còn cái em nói focus thì anh chưa nghĩ tới
- e mới cầm máy ảnh lên
- có xoá phông ấy
- chỉ nói thêm là ví dụ đưa ra được output cụ thể
- :v
- okey
- vấn đề và lợi ích
- còn cái focus của em có vẻ ko liên quan lắm :))
- nói chung là góp ý thế này, ngoài cái ý tưởng
- có chứ, a focus được thì cái focus nó rõ còn các vật xung quanh sẽ mờ lại, vật rõ thì mới được detection, detection được thì mới recognition
- thì chú chịu khó tìm tòi, nhưng kiến thức nền chưa có, nên suy nghĩ vấn đề còn đơn giản, chưa thấy được độ phức tạp thực sự
- dạ 😛
- nên chỉ có thể làm mấy thứ nhìn có vẻ cool (đúng là cool hơn mấy người ko làm gì) nhưng giải quyết vấn đề tới nơi tới chốn thì bất khả thi
- vâng 😛
- học ở VN thì ko chât lượng, nhưng ko học thì bó tay đấy, ít nhất phải theo học course online nào đấy tới nơi tới chốn
- có nền tảng
- kết hợp với tìm tòi giải pháp bên ngoài thì mới ổn
- vậy nhé
- anh đi ngủ
- Trần Nguyễn Duy Tuấn
- Tuấn
- a đưa ra 1 vấn đề cho mình giải quyết
Advertisement
Add Comment
Please, Sign In to add comment